1 paper
Lixu Wang, Bingqi Shang, Yi Li +4
Vision Transformers (ViTs), extensively pre-trained on large-scale datasets, have become essential to foundation models, allowing excellent performance on diverse downstream tasks…