1 paper · 1 filter
Outongyi Lv, Yuanwei Zhang, Xiaoqun Zhang
Reinforcement learning (RL), particularly RL with Verifiable Rewards (RLVR), has recently emerged as a central paradigm for enhancing large language models' (LLMs) reasoning abilit…