1 paper
Haoran Sun, Jingqi Xu, Yanhui Li +3
Vision-Language Models (VLMs) have demonstrated remarkable capabilities in multimodal tasks, yet they still exhibit poor ability in spatial reasoning. Existing training-dependent a…