1 paper
Qian-Wei Wang, Guanghao Meng, Ren Cai +2
Large-scale vision-language models (VLMs) such as CLIP exhibit strong zero-shot generalization, but adapting them to downstream tasks typically requires costly labeled data. Existi…