1 paper · 1 filter
Guozhi Liu, Weiwei Lin, Tiansheng Huang +4
Harmful fine-tuning can invalidate safety alignment of large language models, exposing significant safety risks. In this paper, we utilize the attention sink mechanism to mitigate…