1 paper · 1 filter
Mengjun Yi, Hanwen Zhang, Hui Dou +2
Large pre-trained Vision-Language Models (VLMs), such as Contrastive Language-Image Pre-training (CLIP), have exhibited remarkable zero-shot performance across various image classi…