1 paper
Chenrui Wu, Zexi Li, Jiajun Bu +2
Reinforcement Learning with Verifiable Reward (RLVR) has emerged as a powerful post-training paradigm that surpasses Supervised Fine-Tuning (SFT) in eliciting reasoning intelligenc…