1 paper
Jingyue Gao, Yanjiang Guo, Xiaoshuai Chen +1
Reinforcement Learning (RL) significantly enhances the reasoning abilities of large language models (LLMs), yet applying it to multi-turn agentic tasks remains challenging due to t…