1 paper
Lovis Heindrich, Philip Torr, Fazl Barez +1
Sparse autoencoders (SAEs) have emerged as a promising approach in language model interpretability, offering unsupervised extraction of sparse features. For interpretability method…