1 paper
Tianxiang Xu, Jiayi Liu, Yixuan Tong +10
While reinforcement learning for large language model alignment has progressed rapidly in recent years, transferring these paradigms to high-stakes medical question answering revea…