1 paper
Ruojun Xu, Yu Kai, Xuhua Ren +4
Direct Preference Optimization (DPO) has shown promising results in aligning generative outputs with human preferences by distinguishing between chosen and rejected samples. Howeve…