1 citations · 1 across the 1 of their papers we have counts for
1 paper
Duanyu Feng, Bowen Qin, Chen Huang +2
Direct Preference Optimization (DPO), which derives reward signals directly from pairwise preference data, has shown its effectiveness on aligning Large Language Models (LLMs) with…