1 paper · 1 filter
Ayush Singh, Mansi Gupta, Shivank Garg
Vision Language Models excel in handling a wide range of complex tasks, including Optical Character Recognition (OCR), Visual Question Answering (VQA), and advanced geometric reaso…