1 paper
Ziliang Chen, Tianang Xiao, Jusheng Zhang +2
Contrastive Language-Image Pre-training (CLIP) delivers strong cross modal generalization by aligning images and texts in a shared embedding space, yet it persistently fails at com…