1 paper
Seonglae Cho, Harryn Oh, Donghyun Lee +3
Sparse Autoencoders (SAEs) have emerged as a promising solution for decomposing large language model representations into interpretable features. However, Paulo and Belrose (2025)…