1 paper
Robin Karlsson, Francisco Lepe-Salazar, Kazuya Takeda
Vision-language models (VLMs) transform environment percepts into vision-language semantics interpretable by LLMs. However, completing complex tasks often requires reasoning about…