1 paper · 1 filter
Jun Zhang, Xin Zhang, Jie Feng +5
Multimodal large language models (MLLMs) have demonstrated powerful capabilities in general spatial understanding and reasoning. However, their fine-grained spatial understanding a…