1 paper
Yanqi Dai, Yuxiang Ji, Xiao Zhang +3
Reinforcement Learning with Verifiable Rewards (RLVR) offers a robust mechanism for enhancing mathematical reasoning in large models. However, we identify a systematic lack of emph…