DisPPO: Quantile-Based Distributional Reinforcement Learning for Large Language Models

International Conference on Machine Learning (ICML), 2026

Zhijian Zhou#, Long Li#, Xuan Zhang, Zongkai Liu, Yanting Miao, Yuchen Liu, Deshu Chen, Ke Li, Xing Sun, Ruoxi Jiang*, Xiaoyu Tan*, Chao Qu*†, Yuan Qi*

# Equal contribution    * Corresponding author; Project lead

[PDF]    [Code]