1 paper
Jun Zhang, Xin Zhang, Jie Feng +5
Multimodal large language models (MLLMs) have demonstrated powerful capabilities in general spatial understanding and reasoning. However, their fine-grained spatial understanding a…