1 paper · 1 filter
Anna Soligo, Edward Turner, Senthooran Rajamanoharan +1
Finetuning large language models on narrowly harmful datasets can cause them to become emergently misaligned, giving stereotypically `evil' responses across diverse unrelated setti…