1 paper
Mengyang Li, Haozhan Geng, Zhong Zhang +1
Curriculum learning enhances Direct Preference Optimization (DPO) for aligning Large Language Models (LLMs), yet existing methods rely on a one-dimensional view of difficulty. In t…