1 paper
Weichen Zhang, Zhui Zhu, Ningbo Li +3
Vision-language models (VLMs) have achieved impressive performance on multimodal reasoning tasks such as visual question answering, image captioning and so on, but their inference…