1 paper
Runyu Wang, Bo Liu, Xiaxin Zhang +6
Discovering stable neuron behavior across entire domains remains a challenge in mechanistic interpretability. Existing methods often rely on instance-level point estimates or compu…