1 paper
Lang Cao, Hui Ruan, Yongqian Li +5
Reinforcement learning with group-based objectives, such as Group Relative Policy Optimization (GRPO), is a common framework for aligning large language models on complex reasoning…