1 paper
Suchang Chen, Daqiang Guo
Existing pipelines for vision-language models (VLMs) in robotic manipulation prioritize broad semantic generalization from images and language, but typically omit execution-critica…