1 paper
Junbo Zhang, Qianli Zhou, Xinyang Deng +3
Large language models (LLMs) suffer from degraded safety capabilities even when fine-tuned with benign datasets. However, existing methods for identifying safety-degrading samples…