1 paper · 1 filter
Mingwei Xu, Hao Fang
Reinforcement learning with verifiable rewards (RLVR), due to the deterministic verification, becomes a dominant paradigm for enhancing the reasoning ability of large language mode…