1 paper · 1 filter
Yucheng Zhou, Junwei Sheng, Qianning Wang +1
Supervised Fine-Tuning (SFT) is the predominant paradigm for aligning large language models (LLMs), yet it suffers from optimization instability and limited generalization. Recent…