1 paper · 1 filter
Qiang Liu, Taian Guo, Ruizhi Qiao +1
Reinforcement learning holds significant potential for training large language models (LLMs) to handle multi-turn interactive tasks. However, in long-horizon, multi-turn tasks char…