1 paper
Ao Zhou, Zebo Gu, Tenghao Sun +6
Multimodal Large Language Models (MLLMs) have demonstrated remarkable multimodal understanding capabilities in Visual Question Answering (VQA) tasks by integrating visual and textu…