1 paper · 1 filter
Abhishek Mishra, Mugilan Arulvanan, Reshma Ashok +3
Emergent misalignment poses risks to AI safety as language models are increasingly used for autonomous tasks. In this paper, we present a population of large language models (LLMs)…