1 paper · 1 filter
Huaigang Yang, Ya Li, Min Ren +3
Vision-language models (VLMs) are increasingly used as the reasoning backbone of embodied agents, enabling robots to interpret visual scenes, follow language instructions, and plan…