1 paper
Chenhao Xu, Chang-Tsun Li, Chee Peng Lim +1
Due to its deficiency in prior knowledge (inductive bias), Vision Transformer (ViT) requires pre-training on large-scale datasets to perform well. Moreover, the growing layers and…