1 paper
Pengxiang Cai, Tianchen Fang, Xiaohan Li +3
Reinforcement learning with verifiable rewards (RLVR) is widely viewed as a promising path toward continuously improving large language models. Recent works, however, suggest that…