1 paper · 1 filter
Guowei Wang, Chaokun Yang, Zhenxuan Pan +5
Rollout inference often dominates the wall-clock time of large-scale reinforcement learning (RL). In agentic RL, each trajectory alternates between model generation and environment…