1 paper
Harsha Patnala, Debopriyo Banerjee, Ayush Sunil Munot +1
Structured visual reasoning, such as image puzzles, demands fine-grained visual perception, an ability current Vision Language Models (VLMs) lack. VLMs built on CLIP-based ViT back…