1 paper · 1 filter
Arkadiy Saakyan, Shreyas Kulkarni, Tuhin Chakrabarty +1
Large Vision-Language Models (VLMs) have demonstrated strong capabilities in tasks requiring a fine-grained understanding of literal meaning in images and text, such as visual ques…