1 paper · 1 filter
Amritansh Mishra, Supriyo Chakraborty, Berkcan Kapusuzoglu
Group Relative Policy Optimization (GRPO) eliminates the learned critic in PPO by using the mean reward of grouped rollouts as a baseline. We provide a rigorous derivation of GRPO…