1 paper
Yang Li, Gongle Xue, Yijia Guo +3
Reinforcement learning with verifiable rewards (RLVR), especially Group Relative Policy Optimization (GRPO), has been widely used to improve reasoning in large language models. How…