1 paper
Nima Eshraghi, Lovedeep Gondara, Yuqing Huang +5
Activation steering via sparse autoencoders (SAEs) enables behavioral control of large language models without task-specific fine-tuning, but standard methods apply the steering si…