1 paper
Amaya Dharmasiri, Muzammal Naseer, Salman Khan +1
Large-scale vision 2D vision language models, such as CLIP can be aligned with a 3D encoder to learn generalizable (open-vocabulary) 3D vision models. However, current methods requ…