1 paper
Xikang Yang, Xuehai Tang, Fuqing Zhu +2
Vision-language models (VLMs) seamlessly integrate visual and textual data to perform tasks such as image classification, caption generation, and visual question answering. However…