1 paper · 1 filter
Zhouxiang Fang, Jiawei Zhou, Hanjie Chen
Recent studies show that the safety alignment of large language models (LLMs) can be easily compromised even by seemingly non-adversarial fine-tuning. To preserve safety alignment…