1 paper
Quan Wei, Siliang Zeng, Chenliang Li +9
Reinforcement Learning (RL) approaches have been wildly used to enhance the reasoning capabilities of Large Language Model (LLM) agents in long-horizon, multi-turn scenarios. Such…