1 paper · 1 filter
Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer +1
Reinforcement learning (RL) is often credited with improving reasoning at the expense of factual knowledge. We instead find that reasoning models outperform their instruction-tuned…