1 paper
Zixuan Huang, Yikun Ban, Lean Fu +4
Direct Preference Optimization (DPO) has emerged as an effective approach for aligning large language models (LLMs) with human preferences. However, its performance is highly depen…