1 paper · 1 filter
Gang Li, Yulei Qin, Xiaoyu Tan +6
Reinforcement learning with verifiable rewards (RLVR) has proven effective in eliciting complex reasoning in large language models (LLMs). However, standard RLVR training often lea…