1 paper
Ruixun Liu, Lingyu Kong, Derun Li +1
Multimodal large language models (MLLMs) have shown strong vision-language reasoning abilities but still lack robust 3D spatial understanding, which is critical for autonomous driv…