1 paper · 1 filter
Xiao Wang, Yifei Zhang, YongKang Liu +4
Safety alignment of Large Language Models (LLMs) is extremely fragile, as fine-tuning on a small number of benign samples can erase safety behaviors learned from millions of prefer…