1 paper
Jason Bohne, Pawel Polak, David Rosenberg +2
Direct Preference Optimization (DPO) has recently emerged as a simple and effective alternative to reinforcement learning from human feedback (RLHF) for aligning large language mod…