1 paper · 1 filter
Xinjie Chen, Minpeng Liao, Guoxin Chen +4
Reinforcement learning with verifiable rewards (RLVR) has recently advanced the reasoning capabilities of large language models (LLMs). While prior work has emphasized algorithmic…