1 paper · 1 filter
Wenqiao Zhu, Ji Liu, Lulu Wang +2
Direct Preference Optimization (DPO) is broadly utilized for aligning Large Language Models (LLMs) with human values because of its flexibility. Despite its effectiveness, it has b…