1 paper · 1 filter
Lin Sun, Chuang Liu, Peng Liu +3
Direct Preference Optimization (DPO) have emerged as a popular method for aligning Large Language Models (LLMs) with human preferences. While DPO effectively preserves the relative…