2 papers
cs.LG2026
The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology
Andrzej Szablewski, Gabriel Konar-Steenberg, Raffaello Fornasiere +2
Model organisms (MOs) - language models trained to exhibit undesired or unnatural behaviours - are frequently used as testbeds for evaluating white-box interpretability techniques.…
cs.LG2025
Activation Transport Operators
Andrzej Szablewski, Marek Masiak
The residual stream mediates communication between transformer decoder layers via linear reads and writes of non-linear computations. While sparse-dictionary learning-based methods…