1 paper
Jie Zhu, Ivy Zhang, Minchul Kim +1
We present Subtoken Vision Transformer (SubViT), a selective image tokenization method for fine-grained visual recognition. Standard Vision Transformers compress each fixed-size pa…