1 paper · 1 filter
Chenyu Zhou, Qiliang Jiang, Xu Zhou
Reinforcement learning with verifiable rewards (RLVR) is a standard recipe for training large language models on mathematical reasoning, where an answer verifier serves as a langua…