1 paper
Han Zhou, Adam X. Yang, Laurence Aitchison +2
Reinforcement learning with verifiable rewards (RLVR) has become a leading paradigm for improving the reasoning ability of large language models through outcome-based supervision.…