1 paper · 1 filter
Phuc Minh Nguyen, Chinh D. La, Duy M. H. Nguyen +3
Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a key method for improving Large Language Models' reasoning capabilities, yet recent evidence suggests it may p…