1 paper
Patrick Queiroz Da Silva, Hari Sethuraman, Dheeraj Rajagopal +2
Steering methods for language models (LMs) have gained traction as lightweight alternatives to fine-tuning, enabling targeted modifications to model activations. However, prior stu…