1 paper · 1 filter
Muhammed Furkan Dasdelen, Hyesu Lim, Michele Buck +3
Sparse autoencoders (SAEs) emerged as a promising tool for mechanistic interpretability of transformer-based foundation models. Very recently, SAEs were also adopted for the visual…