1 paper
Yutian Liu, Xu Wang, Difan Zou
Sparse autoencoders (SAEs) disentangle model activations into interpretable features and are widely used for steering large language models. Most existing SAE-based steering method…