1 paper · 1 filter
John Winnicki, Abeynaya Gnanasekaran, Eric Darve
Sparse autoencoders (SAEs) extract millions of interpretable features from a language model, but flat feature inventories aren't very useful on their own. Domain concepts get mixed…