1 paper
Andreas Plesner, Francisco Guzmán, Anish Athalye
Reinforcement Learning with Verifiable Rewards (RLVR) has become a prominent method for post-training Large Language Models (LLMs). However, verifiers are rarely error-free; even d…