1 paper
Jeremy Budd, Javier Ideami, Benjamin Macdowall Rynne +2
Sparse autoencoders (SAEs) have received considerable recent attention as tools for mechanistic interpretability, showing success at extracting interpretable features even from ver…