1 paper · 1 filter
Yang Zhou, Zixuan Huang, Sunzhu Li +10
Vision-language models (VLMs) are increasingly used in embodied agents to interpret visual inputs, reason about spatial relationships, and make task-level decisions based on that r…