1 paper
Shaona Ghosh, Amrita Bhattacharjee, Yftah Ziser +1
Fine-tuning large language models (LLMs) to adapt to evolving safety policies is costly and impractical. Mechanistic interpretability enables inference-time control through latent…