1 paper
Langzhou He, Junyou Zhu, Yue Zhou +7
Agentic reinforcement learning trains large language models using multi-turn trajectories that interleave long reasoning traces with short environment-facing actions. Common policy…