1 paper
Guofeng Mei, Bin Ren, Qinfeng Xiao +8
Vision-language models, such as CLIP, encode rich semantic knowledge through large-scale image-text pretraining. Reusing these models for 3D understanding is highly desirable, beca…