1 paper
Junyuan Fang, Zihan Wang, Yejun Zhang +3
Vision-language models (VLMs) have demonstrated impressive zero-shot transfer capabilities in image-level visual perception tasks. However, they fall short in 3D instance-level seg…