1 paper · 2 filters
Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan +1
Reinforcement learning (RL) based on the final answer's reward has driven recent progress in small language models (SLMs) on reasoning-heavy tasks such as math and code. However, a…