1 paper
Aoran Mei, Jianhua Wang, Guo-Niu Zhu +1
With their prominent scene understanding and reasoning capabilities, pre-trained visual-language models (VLMs) such as GPT-4V have attracted increasing attention in robotic task pl…