1 paper
Takahiro Naruko, Hiroaki Akutsu
Vision Transformer (ViT) models have made breakthroughs in image embedding extraction, which provide state-of-the-art performance in tasks such as zero-shot image classification. H…