2 papers
cs.LG2025
Why DPO is a Misspecified Estimator and How to Fix It
Aditya Gopalan, Sayak Ray Chowdhury, Debangshu Banerjee
Direct alignment algorithms such as Direct Preference Optimization (DPO) fine-tune models based on preference data, using only supervised learning instead of two-stage reinforcemen…
cs.AI2024
Towards Reliable Alignment: Uncertainty-aware RLHF
Debangshu Banerjee, Aditya Gopalan
Recent advances in aligning Large Language Models with human preferences have benefited from larger reward models and better preference data. However, most of these methodologies r…