1 paper · 1 filter
David Kaczér, Magnus Jørgenvåg, Clemens Vetter +4
Fine-tuning lets practitioners repurpose aligned large language models (LLMs) for new domains, yet recent work reveals emergent misalignment (EM): Even a small, domain-specific fin…