1 paper
Lucas Dionisopoulos, Nicklas Majamaki, Prithviraj Ammanabrolu
We study how reasoning evolves in a language model -- from supervised fine-tuning (SFT) to reinforcement learning (RL) -- by analyzing how a set of theoretically-inspired datasets…