1 paper · 1 filter
Joel Valdivia Ortega, Lorenz Lamm, Franziska Eckardt +3
Vision Transformers (ViTs), such as DINOv2, achieve strong performance across domains but often repurpose low-informative patch tokens in ways that reduce the interpretability of a…