1 paper
Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi
Vision-language models (VLMs) are increasingly deployed as reasoning agents in real-world visual assessment pipelines, yet their spatial grounding remains unreliable for fine-grain…