1 paper · 1 filter
Shangyu Xing, Siyuan Wang, Chenyuan Yang +2
Reinforcement Learning with Verifiable Rewards (RLVR), particularly with algorithms like Group Relative Policy Optimization (GRPO), has proven highly effective in enhancing the rea…