1 paper
Shivam Ratnakar, Kartikeya Vats
Modern Large Language Models (LLMs) rely on extensive safety alignment, yet the mechanistic basis of refusal remains opaque. In this work, we investigate whether safety compliance…