1 paper
Haozhong Wang, Zhuo Li, Yibo Yang +3
The inherent safety alignment of Large Language Models (LLMs) is prone to erosion during fine-tuning, even when using seemingly innocuous datasets. While existing defenses attempt…