1 paper
Jiaying Zhang, Lei Shi, Jiguo Li +4
Reinforcement Learning with Verifiable Rewards (RLVR) is a key paradigm for improving large-scale reasoning models. Unlike supervised fine-tuning (SFT), RLVR exhibits distinct opti…