1 paper · 1 filter
Nimrod Shabtay, Itamar Zimerman, Eli Schwartz +1
Contrastive Language-Image Pre-training (CLIP) relies on Vision Transformers whose attention mechanism is susceptible to spurious correlations, and scales quadratically with resolu…