1 paper · 1 filter
Yong Yang, Roger Newman-Norlund, Xiang Guan +10
Interpretability methods for large language models (LLMs) describe internal state but do not directly test whether that state is causally sufficient to produce the observed behavio…