1 paper · 1 filter
Gaurav Shinde, Anuradha Ravi, Emon Dey +3
Vision-language models (VLMs) integrate visual and textual information, enabling a wide range of applications such as image captioning and visual question answering, making them cr…