1 paper
Massoud Dehghan, Ramona Woitek, Amirreza Mahbod
Vision Transformers (ViTs) and their variants have become state-of-the-art in many computer vision tasks and are widely used as backbones in large-scale vision and vision-language…