1 paper
Wenquan Lu, Hai Huang, Enqi Liu +1
Reinforcement learning algorithms such as group-relative policy optimization (GRPO) have shown strong potential for improving the mathematical reasoning capabilities of large langu…