1 paper
Peizheng Guo, Jianqi Zhang, Xingyu Zhang +4
Group Relative Policy Optimization (GRPO) has become a widely used approach for post-training Large Language Models (LLMs) for reasoning. In GRPO, the group gradients induced by di…