1 paper
Ruoyu Wang, Jiachen Sun, Shaowei Hua +1
Direct Preference Optimization (DPO) is a method for enhancing model performance by directly optimizing for the preferences or rankings of outcomes, instead of traditional loss fun…