10 citations · 16 across the 16 of their papers we have counts for
1 paper · 1 filter
Zikang Liu, Tongtian Yue, Yepeng Tang +5
Group Relative Policy Optimization (GRPO) enhances policy learning by computing gradients from relative comparisons among candidate outputs that share a common input prefix. Despit…