1 paper · 1 filter
Dongyub Jude Lee, Zhenyi Ye, Pengcheng He
Preference-learning methods for machine translation (MT), such as Direct Preference Optimization (DPO), have shown strong gains but typically rely on large, carefully curated prefe…