1 paper
Ruyang Liu, Jingjia Huang, Wei Gao +2
Large-scale image-language pretrained models, e.g., CLIP, have demonstrated remarkable proficiency in acquiring general multi-modal knowledge through web-scale image-text data. Des…