1 paper
Mingxuan Fan, Peiyang Liu
Group-based reinforcement learning (RL) has become an effective paradigm for improving large language model agents on long-horizon interactive tasks. To obtain finer-grained policy…