1 paper
A. Alfarano, L. Venturoli, D. Negueruela del Castillo
Multimodal Large Language Models (MLLMs) have demonstrated significant capabilities in joint visual and linguistic tasks. However, existing Visual Question Answering (VQA) benchmar…