1 paper
Zhanyu Liu, Qingguo Hu, Ante Wang +5
Reinforcement Learning with Verifiable Reward (RLVR) has proven effective for training reasoning-oriented large language models, but existing methods largely assume high-resource s…