1 paper
Jiaqing Zhang, Mingxiang Cao, Xue Yang +2
Visual language models like Contrastive Language-Image Pretraining (CLIP) have shown impressive performance in analyzing natural images with language information. However, these mo…