1 paper
Daniel Aarao Reis Arturi, Eric Zhang, Andrew Ansah +3
Recent work has discovered that large language models can develop broadly misaligned behaviors after being fine-tuned on narrowly harmful datasets, a phenomenon known as emergent m…