1 paper · 1 filter
Yiming Tang, Qinglin Qi, Zhaoqian Yao +2
Mechanistic interpretability has made significant strides in understanding neural network representations, with sparse dictionary learning (SDL) methods, most prominently sparse au…