1 paper · 1 filter
Yujun Li, Hongyuan Zhang, Yuan Yuan
Group Relative Policy Optimization (GRPO) has recently shown strong performance in post-training large language models and vision-language models. It raises a question of whether t…