1 paper · 1 filter
Suchang Chen, Daqiang Guo
Existing pipelines for vision-language models (VLMs) in robotic manipulation prioritize broad semantic generalization from images and language, but typically omit execution-critica…