1 paper
Kavin Aravindan, Arihant Rastogi, Aadi Prasad +4
Activation steering provides a lightweight mechanism for controlling large language models at inference time, but steering vectors can have unintended externalities: utility vector…