1 paper · 1 filter
Wei Liu, Yang Bai, Chengcheng Han +5
Direct Preference Optimization (DPO) is widely utilized in the Reinforcement Learning from Human Feedback (RLHF) phase to align Large Language Models (LLMs) with human preferences,…