1 paper
Songping Peng, Zhiheng Zhang, Daojian Zeng +2
Safety alignment in Large Language Models (LLMs) remains highly fragile during fine-tuning, where even benign adaptation can degrade pre-trained refusal behaviors and enable harmfu…