TRACE-GRPO: Teacher-Refined Advantage Credit Estimation for Long-Horizon Agentic RL

Conference on Empirical Methods in Natural Language Processing (EMNLP), 2026

Yuchen Liu, Tianchu Yao, Yinghao Zhang, Xigui Li, Deshu Chen, Zehui Ling, Xin Guo, Yuan Cheng, Lintao Ma, Chao Qu*, Yuan Qi*

* Corresponding author

[PDF]    [Code]