1 paper · 1 filter
Xin Wang, Kai Chen, Jiaming Zhang +2
Large pre-trained Vision-Language Models (VLMs) such as CLIP have demonstrated excellent zero-shot generalizability across various downstream tasks. However, recent studies have sh…