2 papers
cs.CV2026
Look Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question Answering
Marco Morini, Sara Sarto, Marcella Cornia +2
Knowledge-based Visual Question Answering (KB-VQA) requires Multimodal Large Language Models (MLLMs) to identify and combine fine-grained visual cues with retrieved textual evidenc…
cs.CV2026
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
Alberto Compagnoni, Marco Morini, Sara Sarto +5
Multimodal Large Language Models (MLLMs) have shown impressive capabilities in jointly understanding text, images, and videos, often evaluated via Visual Question Answering (VQA).…