1 paper · 1 filter
Seonglae Cho, Harryn Oh, Donghyun Lee +3
Sparse Autoencoders (SAEs) have emerged as a promising solution for decomposing large language model representations into interpretable features. However, Paulo and Belrose (2025)…