1 paper
Hengrui Gu, Xiaotian Han, Yujing Bian +2
Reinforcement learning with verifiable rewards (RLVR) has substantially improved the reasoning ability of large language models (LLMs), but it often suffers from \textit{restricted…