1 paper
Alan Z. Song, Yinjie Chen, Mu Nan +8
Vision Transformers (ViTs) achieve strong data-driven scaling by leveraging all-to-all self-attention. However, this flexibility incurs a computational cost that scales quadratical…