1 paper
Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid +3
Vision-Language Models (VLMs) excel at multimodal reasoning, yet it remains unclear whether their answers are grounded in visual evidence or driven by learned language and world pr…