1 paper
Sijia Li, Yuchen Huang, Zifan Liu +7
Reinforcement learning has become a widely used post-training approach for LLM agents, where training commonly relies on outcome-level rewards that provide only coarse supervision.…