1 paper
Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3
Direct Preference Optimization (DPO) is a widely used RL-free method for aligning language models from pairwise preferences, but it models preferences over full sequences even thou…