1 paper · 1 filter
Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov +1
Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as an indispensable paradigm for enhancing reasoning in Large Language Models (LLMs). However, standard policy opt…