1 paper
Xiaoyu Qiu, Hao Feng, Yuechen Wang +2
Pre-trained vision-language models (VLMs) have shown remarkable generalization capabilities via prompting, which leverages VLMs as knowledge bases to extract information beneficial…