1 paper · 1 filter
Waldemar Chang
Understanding how language models carry out long-horizon reasoning remains an open challenge. Existing interpretability methods often highlight tokens correlated with an answer, bu…