1 paper
Yixuan Wang, Yifei Chen, Haichao Zhang +6
Reinforcement learning (RL) with group-relative advantages has become the de facto standard for post-training language model reasoners. However, when optimizing multiple reward obj…