1 paper
Fanrui Zhang, Ruixue Ding, Qiang Zhang +13
Training open-ended agents via reinforcement learning (RL) is hindered by the lack of verifiable gold answers and scalable rubrics. Moreover, even near the model's capability bound…