1 paper
Mohammad Mahdi Abootorabi, Armin Saghafian, Ali Bazshoushtari +5
As large language models (LLMs) are increasingly deployed in alignment-sensitive contexts, activation steering has emerged as a lightweight, inference-time alternative to fine-tuni…