1 paper · 1 filter
Guoli Wang, Haonan Shi, Tu Ouyang +1
Large language models (LLMs) often require fine-tuning (FT) to perform well on downstream tasks, but FT can induce safety-alignment drift even when the training dataset contains on…