1 paper · 1 filter
Yiting Liu, Zhi-Hong Deng
Sparse autoencoders (SAEs) have emerged as a powerful technique for decomposing language model representations into interpretable features. Current interpretation methods infer fea…