1 paper
Taojie Zhu, Yuan Xia, Tao Sun +8
Reinforcement learning with verifiable rewards has been especially effective in mathematics and coding, where answers can be checked automatically. Many open-ended medical question…