1 paper · 1 filter
Haozhong Wang, Zhuo Li, Yibo Yang +3
The inherent safety alignment of Large Language Models (LLMs) is prone to erosion during fine-tuning, even when using seemingly innocuous datasets. While existing defenses attempt…