1 paper · 1 filter
Hanxu Hu, Yuxuan Wang, Maggie Huan +4
Reinforcement learning with Verifiable Rewards (RLVR) has emerged as a powerful paradigm for eliciting reasoning capabilities in large language models, particularly in mathematics…