1 paper · 1 filter
Zhengxi Lu, Zhiyuan Yao, Zhuowen Han +8
Reinforcement learning (RL) has emerged as a central paradigm for post-training LLM agents, yet its trajectory-level reward signal provides only coarse supervision for long-horizon…