1 paper · 1 filter
Dong Du, Shulin Liu, Tao Yang +2
Recent advances in large language models (LLMs) have highlighted the potential of reinforcement learning with verifiable rewards (RLVR) to enhance reasoning capabilities through ex…