1 paper
Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim
Direct Preference Optimization (DPO) and related methods align large language models from pairwise preferences by regularizing updates against a fixed reference policy. As the poli…