1 paper · 1 filter
Jyotin Goel, Souvik Maji, Pratik Mazumder
Instruction-following language models are trained to be helpful and safe, yet their safety behavior can deteriorate under benign fine-tuning and worsen under adversarial updates. E…