1 paper
Gang Li, Yan Chen, Ming Lin +1
Recent large reasoning models (LRMs) driven by reinforcement learning algorithms (e.g., GRPO) have achieved remarkable performance on challenging reasoning tasks. However, these mo…