1 paper · 1 filter
Cansu Sancaktar, David Zhang, Gabriel Synnaeve +1
Reinforcement learning (RL) has emerged as a powerful paradigm for improving large language models beyond supervised fine-tuning, yet sustaining performance gains at scale remains…