1 paper
Xin Yao, Haiyang Zhao, Yimin Chen +3
The Contrastive Language-Image Pretraining (CLIP) model has significantly advanced vision-language modeling by aligning image-text pairs from large-scale web data through self-supe…