1 paper · 1 filter
Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar +3
Vision-language models (VLMs) are used as high-level planners for embodied agents, translating natural language instructions and visual observations into action plans. While prior…