1 paper
Xuefeng Hu, Ke Zhang, Min Sun +3
Large-scale pretrained vision-language models like CLIP have demonstrated remarkable zero-shot image classification capabilities across diverse domains. To enhance CLIP's performan…