Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Vision Transformers Need Better Token Interaction
Linxiang Su
Vision Transformers (ViTs) can learn strong image-level representations while their patch representations become less effective for dense prediction during prolonged training. We r…
cs.CV2026
ATAC: Augmentation-Based Test-Time Adversarial Correction for CLIP
Linxiang Su, András Balogh
Despite its remarkable success in zero-shot image-text matching, CLIP remains highly vulnerable to adversarial perturbations on images. As adversarial fine-tuning is prohibitively…