1 paper
Karim Saraipour, Shichang Zhang
Transformer-based language models (LMs) can perform a wide range of tasks, and mechanistic interpretability (MI) aims to reverse engineer the components responsible for task comple…