1 citations · 1 across the 4 of their papers we have counts for
1 paper · 1 filter
Pengwei Sun
Offline preference optimization has become a practical substitute for reinforcement learning from human feedback, but pairwise objectives such as Direct Preference Optimization (DP…