1 paper · 1 filter
Runyu Wang, Bo Liu, Xiaxin Zhang +6
Discovering stable neuron behavior across entire domains remains a challenge in mechanistic interpretability. Existing methods often rely on instance-level point estimates or compu…