1 paper · 1 filter
Ashwath Vaithinathan Aravindan, Abha Jha, Mihir Kulkarni
Vision-Language Models (VLMs) have shown remarkable performance in integrating visual and textual information for tasks such as image captioning and visual question answering. Howe…