1 paper
Peter A. Massih, Eric Cosatto
Current Vision-Language Models (VLMs) fail at quantitative spatial reasoning because their architectures destroy pixel-level information required for counting and measurements. Vis…