1 paper · 1 filter
Junkang Wu, Yuexiang Xie, Zhengyi Yang +5
Direct Preference Optimization (DPO) has emerged as a compelling approach for training Large Language Models (LLMs) to adhere to human preferences. However, the performance of DPO…