1 paper · 1 filter
Haoxian Chen, Hanyang Zhao, Henry Lam +2
Direct Preference Optimization (DPO) has recently emerged as a popular approach to improve reinforcement learning with human feedback (RLHF), leading to better techniques to fine-t…