1 paper · 1 filter
Chaoran Zhu, Hengyi Wang, Yik Lung Pang +1
Visual-textual understanding is essential for language-guided robot manipulation. Recent works leverage pre-trained vision-language models to measure the similarity between encoded…