1 paper
Song Yu, Li Li, Wenwen Zhao +1
Reinforcement learning from verifiable rewards has significantly advanced the reasoning capabilities of large language models. However, Group Relative Policy Optimization (GRPO) ty…