1 paper · 1 filter
Xuemiao Zhang, Can Ren, Chengying Tu +5
Recent progress in large reasoning models for challenging mathematical reasoning has been driven by reinforcement learning (RL). Incorporating long chain-of-thought (CoT) data duri…