2 papers
cs.CV2026
Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment
Spiros Baxevanakis, Platon Karageorgis, Ioannis Dravilas +1
Training Vision Transformers (ViTs) presents significant challenges, one of which is the emergence of artifacts in attention maps, hindering their interpretability. Darcet et al. (…
cs.HC2026
InfoCIR: Multimedia Analysis for Composed Image Retrieval
Ioannis Dravilas, Ioannis Kapetangeorgis, Anastasios Latsoudis +3
Composed Image Retrieval (CIR) allows users to search for images by combining a reference image with a text prompt that describes desired modifications. While vision-language model…