1 paper · 1 filter
Shuaijie She, Yu Bao, Yu Lu +7
We present DuPO, a dual learning-based preference optimization framework that generates annotation-free feedback via a generalized duality. DuPO addresses two key limitations: Rein…