1 paper
Sagnik Mukherjee, Lifan Yuan, Pavan Jayasinha +2
Reinforcement learning (RL), particularly RL from verifiable reward (RLVR), has become a crucial phase of training large language models (LLMs) and a key focus of current scaling e…