1 paper
Weiheng Zhao, Zilong Huang, Jiashi Feng +1
Contrastive Language-Image Pretraining (CLIP) achieves strong generalization in vision-language tasks by aligning images and texts in a shared embedding space. However, recent find…