1 paper
Abhishek Mishra, Mugilan Arulvanan, Reshma Ashok +3
Emergent misalignment poses risks to AI safety as language models are increasingly used for autonomous tasks. In this paper, we present a population of large language models (LLMs)…