1 paper
Ismail Hossain, Sai Puppala, Jannatul Ferdaus +4
A guard model fine-tuned on entirely benign data can lose all safety alignment -- not through adversarial manipulation, but through standard domain specialization. We demonstrate t…