1 paper
Jiachen Zhao, Zhengxuan Wu, Aryaman Arora +3
The mechanisms behind LLMs' broad over-generalization beyond training examples remain unclear. Emergent misalignment (EM) offers a striking case study: finetuning on narrow tasks i…