1 paper
Ruosen Zhao, Zhikang Zhang, Jialei Xu +5
Large vision-language models (VLMs) show strong multimodal understanding but still struggle with 3D spatial reasoning, such as distance estimation, size comparison, and cross-view…