1 paper
Xinzhu Chen, Xuesheng Li, Zhongxiang Sun +1
Reinforcement Learning with Verifiable Rewards (RLVR) has become a central approach for improving the reasoning ability of large language models. Recent work studies RLVR through t…