1 paper · 1 filter
Deepayan Das, Davide Talon, Massimiliano Mancini +2
Vision-Language Models (VLMs) have shown significant promise in Visual Question Answering (VQA) tasks by leveraging web-scale multimodal datasets. However, these models often strug…