1 paper
Haifeng Huang, Yilun Chen, Zehan Wang +2
Recent advancements in multi-modal large language models (MLLMs) have shown strong potential for 3D scene understanding. However, existing methods struggle with fine-grained object…