1 paper
Ege Ãakar, Hannah Guan, Kayden Kehe
Behavioral alignment in large language models often masks fragile internal safety representations. Recent work suggests that refusal behavior is mediated by low-dimensional directi…