1 paper · 1 filter
Tobias Labarta, Maximilian Dreyer, Katharina Weitz +2
Explainable AI (XAI) methods reveal which features influence model predictions, yet provide limited means for practitioners to act on these explanations. Activation steering of com…