1 paper
Philippe Chlenski, Zachariah Carmichael, Ayush Warikoo +5
Mechanistic interpretability (MI) requires full access to model internals, yet the APIs for most widely deployed language models at best expose log-probabilities over output tokens…