1 paper
Yuli Wang, Hyewon Jung, Dongshen Peng +10
Vision Transformer (ViT) models, utilizing self-attention mechanisms, have demonstrated robust generalization capabilities across various vision tasks, including image classificati…