1 paper
Tommy Sha, Skylar Zhai, Siqi Zhao
In reinforcement learning with verifiable rewards (RLVR) trained with group relative policy optimization (GRPO), the KL-free reward-advantage term studied here depends on within-gr…