1 paper · 1 filter
Daniil Ognev, Célian Vasson, Lijie Hu +2
Sparse autoencoders (SAEs) are widely used to interpret language model activations, but SAE training and latent labelling are typically repeated for every model. Here, we show that…