1 paper
Bartosz Wieciech, Zmnako Awrahman, Marcin Czelej +2
Sparse Autoencoders (SAEs) extract interpretable features from Large Language Model activations, but standard variants enforce non-negative latents, so a bidirectional semantic axi…