1 paper
Jiaxin Liu, Ding Zhong, Yue Wang +6
Vision-language models (VLMs) have demonstrated remarkable capabilities in bridging visual perception and natural language understanding, enabling a wide range of multimodal reason…