1 paper
Ruiyi Ding, Jie Li, He Kang +4
Group Relative Policy Optimization (GRPO) is a powerful reinforcement learning algorithm for aligning generative models with human preferences. While successful in large language m…