1 paper
Yubo Zhang, Xinhong Ma, Zezhong Tan +1
Group Relative Policy Optimization (GRPO) learns from reward differences within a rollout group, but receives no useful relative signal when every sampled response is incorrect. Pr…