1 paper
Peng Liu, Haozhan Shen, Chunxin Fang +3
Vision-Language Models (VLMs) excel at high-level scene understanding but falter on fine-grained perception tasks requiring precise localization. This failure stems from a fundamen…