1 paper
Anh Pham, Mihir Thalanki, Michael Sun +6
Large language models often lose previously aligned safety behaviors when fine-tuned on benign data, a phenomenon known as catastrophic forgetting. Prior work shows that adding ran…