1 paper
Yanchun Cheng, Rundong Wang, Xulei Yang +4
Spatial reasoning from monocular images is essential for autonomous driving, yet current Vision-Language Models (VLMs) still struggle with fine-grained geometric perception, partic…