1 paper · 1 filter
Jue Jiang, Aneesh Rangnekar, Chloe Min Seo Choi +1
Pretraining vision transformers (ViT) with attention guided masked image modeling (MIM) has shown to increase downstream accuracy for natural image analysis. Hierarchical shifted w…