1 paper
Qi Zhang, Yuxu Chen, Lei Deng +1
Contrastive Language-Image Pretraining (CLIP) has achieved remarkable performance in various multimodal tasks. However, it still struggles with compositional image-text matching, p…