1 paper · 1 filter
Alex Gulko, Yusen Peng, Sachin Kumar
Sparse autoencoders (SAEs) are a promising approach for uncovering interpretable features in large language models (LLMs). While several automated evaluation methods exist for SAEs…