1 paper
Zhongqi Wang, Jia Dai, Kai Li +3
Vision language model (VLM) has been designed for large scale image-text alignment as a pretrained foundation model. For downstream few shot classification tasks, parameter efficie…