1 paper · 1 filter
Zhitong Wang, Songze Li, Hao Peng +4
Reinforcement learning (RL) has emerged as a powerful paradigm for training Large Language Models (LLMs) as agents. However, conventional RL methods for long-horizon agentic tasks…