1 paper · 1 filter
Valentin Bieri, Marco Zamboni, Nicolas S. Blumer +2
Vision-language models (VLMs) show great promise for 3D scene understanding but are mainly applied to indoor spaces or autonomous driving, focusing on low-level tasks like segmenta…