1 paper
Jyotin Goel, Souvik Maji, Pratik Mazumder
Instruction-following language models are trained to be helpful and safe, yet their safety behavior can deteriorate under benign fine-tuning and worsen under adversarial updates. E…