1 paper
Joel Valdivia Ortega, Lorenz Lamm, Franziska Eckardt +3
Vision Transformers (ViTs), such as DINOv2, achieve strong performance across domains but often repurpose low-informative patch tokens in ways that reduce the interpretability of a…