1 paper
Zhe Cao, Miaowen Wen, Fangjiong Chen
Reinforcement learning with verifiable rewards (RLVR) com- monly optimizes each correct completion as an independent learning signal. In GRPO, this completion-level uniformity crea…