1 paper
Songtao Jiang, Yan Zhang, Chenyi Zhou +4
Multimodal Large Language Models (MLLMs) such as GPT-4V and Gemini Pro face challenges in achieving human-level perception in Visual Question Answering (VQA), particularly in objec…