1 paper · 1 filter
Yueqin Yin, Zhendong Wang, Yi Gu +3
In the field of large language models (LLMs), aligning models with the diverse preferences of users is a critical challenge. Direct Preference Optimization (DPO) has played a key r…