1 paper · 1 filter
Jia Zhang, Zhi Zhou, Lan-Zhe Guo +1
Vision-language models (VLMs) like CLIP have demonstrated impressive zero-shot ability in image classification tasks by aligning text and images but suffer inferior performance com…