1 paper
Haruhiko Murata, Kazuhiro Hotta
Vision Transformers (ViT) have been established as large-scale foundation models. However, because self-attention operates globally, they lack an explicit mechanism to distinguish…