1 paper · 1 filter
Lixu Wang, Bingqi Shang, Yi Li +4
Vision Transformers (ViTs), extensively pre-trained on large-scale datasets, have become essential to foundation models, allowing excellent performance on diverse downstream tasks…