1 paper
Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit +2
Large reasoning models trained via reinforcement learning (RL) have been increasingly shown to outperform their supervised fine-tuned (SFT) counterparts on mathematical reasoning t…