1 paper · 1 filter
Jianghao Wu, Jianfei Cai, Weiqiang Wang +3
Reinforcement learning with verifiable rewards (RLVR) can yield large reasoning gains from very few training instances, yet its strong sensitivity to which instances are used makes…