DisPPO: Quantile-Based Distributional Reinforcement Learning for Large Language Models
International Conference on Machine Learning (ICML), 2026
Zhijian Zhou#, Long Li#, Xuan Zhang, Zongkai Liu, Yanting Miao, Yuchen Liu, Deshu Chen, Ke Li, Xing Sun, Ruoxi Jiang*, Xiaoyu Tan*, Chao Qu*†, Yuan Qi*
# Equal contribution * Corresponding author; † Project lead
[PDF] [Code]
