1 paper · 1 filter
Pei-Xi Xie, Che-Yu Lin, Cheng-Lin Yang
Reinforcement learning with verifiable rewards (RLVR) can improve low-k reasoning accuracy while narrowing solution coverage on challenging math questions, and pass@1 gains do no…