1 paper · 1 filter
Qiming Bao, Juho Leinonen, Paul Denny +1
Direct Preference Optimization (DPO), the efficient alternative to PPO-based RLHF, falls short on knowledge-intensive generation: standard preference signals from human annotators…