1 paper
Krishak Aneja, Manas Mittal, Anmol Goel +2
Fine-tuning Large Language Models (LLMs) on benign narrow data can sometimes induce broad harmful behaviors, a vulnerability termed emergent misalignment (EM). While prior work lin…