1 paper
Yonghui Wang, Shi-Yong Chen, Zhenxing Zhou +4
Recently, Vision Language Models (VLMs) have experienced significant advancements, yet these models still face challenges in spatial hierarchical reasoning within indoor scenes. In…