1 paper · 1 filter
Mohammad Mahdi Abootorabi, Armin Saghafian, Ali Bazshoushtari +5
As large language models (LLMs) are increasingly deployed in alignment-sensitive contexts, activation steering has emerged as a lightweight, inference-time alternative to fine-tuni…