1 paper · 1 filter
Ayush Singh, Mansi Gupta, Shivank Garg +2
Vision-Language Models (VLMs) have transformed tasks requiring visual and reasoning abilities, such as image retrieval and Visual Question Answering (VQA). Despite their success, V…