1 paper
Jiang-Xin Shi, Chi Zhang, Tong Wei +1
Pre-trained vision-language models like CLIP have shown powerful zero-shot inference ability via image-text matching and prove to be strong few-shot learners in various downstream…