1 paper · 1 filter
Xikang Yang, Xuehai Tang, Fuqing Zhu +2
Vision-language models (VLMs) seamlessly integrate visual and textual data to perform tasks such as image classification, caption generation, and visual question answering. However…