1 paper · 1 filter
Qian-Wei Wang, Guanghao Meng, Ren Cai +2
Large-scale vision-language models (VLMs) such as CLIP exhibit strong zero-shot generalization, but adapting them to downstream tasks typically requires costly labeled data. Existi…