1 paper · 1 filter
Yuxin Jiang, Bo Huang, Yufei Wang +7
Direct preference optimization (DPO), a widely adopted offline preference optimization algorithm, aims to align large language models (LLMs) with human-desired behaviors using pair…