1 paper · 1 filter
Haoxiang Guan, Jiyan He, Jie Zhang
Sparse autoencoders (SAEs) have recently emerged as a powerful tool for interpreting the internal representations of large language models (LLMs), revealing latent latent features…