1 paper
Tsung-Chih Chiang, Hsuan-Kung Yang, Jou-Min Liu +4
Recent zero-shot 3D visual grounding methods leverage vision-language models (VLMs) to localize objects in 3D scenes from natural language queries. However, these methods typically…