1 paper
Dezhi Yu, Yvonne Qiu, ShuoJia Fu
We present an approach to fine-tuning large language models using Direct Preference Optimization (DPO), a reinforcement learning technique. Our experimental results demonstrate tha…