1 paper · 1 filter
Jeanice Koorndijk
Current literature suggests that alignment faking (deceptive alignment) is an emergent property of large language models. We present the first empirical evidence that a small instr…