1 paper · 1 filter
Shaohang Wei, Zikun Su, Feifan Song +4
We show that on-policy reinforcement learning with verifiable rewards (RLVR) can improve the current objective while making successful behaviors for later objectives too rare to sa…