1 paper · 1 filter
Jefferson Hernandez, Jaywon Koo, Zilin Xiao +2
Group-based reinforcement learning objectives such as GRPO can allocate learning signal poorly across prompt difficulty: under binary rewards, group normalization induces a diverge…