1 paper · 1 filter
Wenhao Deng, Long Wei, Chenglei Yu +1
Reinforcement learning with verifiable rewards (RLVR) has recently enhanced the reasoning capabilities of large language models (LLMs), particularly for mathematical problem solvin…