1 paper · 1 filter
Jin Gao, Shubo Lin, Shaoru Wang +7
Masked image modeling (MIM) pre-training for large-scale vision transformers (ViTs) has enabled promising downstream performance on top of the learned self-supervised ViT features.…