1 paper · 1 filter
Zhiqin Yang, Yonggang Zhang, Wei Xue +3
Direct Preference Optimization (DPO) has emerged as a popular alternative to Reinforcement Learning from Human Feedback (RLHF), offering theoretical equivalence with simpler implem…