TRACE-GRPO: Teacher-Refined Advantage Credit Estimation for Long-Horizon Agentic RL
Conference on Empirical Methods in Natural Language Processing (EMNLP), 2026
Yuchen Liu, Tianchu Yao, Yinghao Zhang, Xigui Li, Deshu Chen, Zehui Ling, Xin Guo, Yuan Cheng, Lintao Ma, Chao Qu*, Yuan Qi*
* Corresponding author
[PDF] [Code]
