1 paper · 1 filter
Naifan Zhang, Ruihan Sun, Jinwei Su +4
Reinforcement learning (RL) for large language models (LLMs) has shown strong performance in single-turn tasks, but extending it to multi-turn interaction remains challenging due t…