1 paper · 1 filter
Junshu Pan, Wei Shen, Shulin Huang +2
Direct Preference Optimization (DPO) simplifies reinforcement learning from human feedback (RLHF) for large language models (LLMs) by directly optimizing human preferences without…