1 paper
Phuc Minh Nguyen, Ngoc-Hieu Nguyen, Duy H. M. Nguyen +5
Direct Alignment Algorithms (DAAs) such as Direct Preference Optimization (DPO) have emerged as alternatives to the standard Reinforcement Learning from Human Feedback (RLHF) for a…