1 paper
Zhigang Wang, Yifei Su, Chenhui Li +4
Open-vocabulary 3D scene understanding is indispensable for embodied agents. Recent works leverage pretrained vision-language models (VLMs) for object segmentation and project them…