1 paper
Nghia Nguyen, Minh Nhat Vu, Tung D. Ta +4
Vision language models have played a key role in extracting meaningful features for various robotic applications. Among these, Contrastive Language-Image Pretraining (CLIP) is wide…