1 paper · 1 filter
Marius Dragoi, Ioana Pintilie, Florin Gogianu +1
Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a powerful paradigm to improve Large Language Models on reasoning tasks such as coding, math or logic. To asses…