1 paper
Xinghua Xue, Cheng Liu, Ying Wang +5
Vision Transformers (ViTs) that leverage self-attention mechanism have shown superior performance on many classical vision tasks compared to convolutional neural networks (CNNs) an…