1 paper · 1 filter
Jingyue Gao, Yanjiang Guo, Xiaoshuai Chen +1
Reinforcement Learning (RL) significantly enhances the reasoning abilities of large language models (LLMs), yet applying it to multi-turn agentic tasks remains challenging due to t…