1 paper · 1 filter
Xiaolong Jin, Dingmin Wang, Vijay Lingam +1
Training multi-turn LLM agents with reinforcement learning typically relies on trajectory-level rewards, which assign a uniform advantage to every step and cannot identify which de…