1 paper
Samyadeep Basu, Shell Xu Hu, Maziar Sanjabi +2
Image-text contrastive models like CLIP have wide applications in zero-shot classification, image-text retrieval, and transfer learning. However, they often struggle on composition…