1 paper
Nikolas Papadopoulos, Shreenithi Navaneethan, Sheng Bai +2
Preference learning methods, such as Reinforcement Learning from Human Feedback (RLHF) and Direct Preference Optimization (DPO), rely on pairwise human judgments, yet little is kno…