1 paper
Weixi Weng, Jieming Zhu, Xiaojun Meng +3
Multimodal large language models (MLLMs) have demonstrated great performance on visual question answering (VQA). When it comes to knowledge-based Visual Question Answering (KB-VQA)…