1 paper
Yuhui Sun, Xiyao Wang, Zixi Li +6
Recent alignment methods based on Direct Preference Optimization (DPO) reformulate preference learning as supervised optimization over pairwise comparisons, offering improved effic…