1 paper · 1 filter
Karuna Bhaila, Aneesh Komanduri, Minh-Hao Van +1
Vision-Language Models (VLMs) have demonstrated immense capabilities in multi-modal understanding and inference tasks such as Visual Question Answering (VQA), which requires models…