1 paper
Wei Li, Zhen Huang, Xinmei Tian
Contrastively trained vision-language models like CLIP, have made remarkable progress in learning joint image-text representations, but still face challenges in compositional under…