1 paper
Mingxuan Li, Qirun Dai, Heran Wang +1
Fine-tuning large language models (LLMs) on narrowly harmful datasets can lead to misalignment broadly, a phenomenon known as emergent misalignment (EM). EM poses a challenge for A…