1 paper
Niklas Herbster, Martin Zborowski, Alberto Tosato +2
Alignment in LLMs is more brittle than commonly assumed: misalignment can be induced by adversarial prompts, benign fine-tuning, emergent misalignment, and goal misgeneralization.…