1 paper
Yujuan Pang, Jiaxin Li, Xin Sheng +2
Reinforcement learning with verifiable rewards (RLVR) is effective for training large language models on deterministic outcome reasoning tasks. Prior work shows RLVR works with few…