1 paper · 1 filter
Shuo Xie, Fangzhi Zhu, Jiahui Wang +6
Aligning Large Language Models (LLMs) with human feedback is crucial for their development. Existing preference optimization methods such as DPO and KTO, while improved based on Re…