Showing cs.ROShow all
2 papers · 1 filter
cs.RO2026
Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning
Xueying Li, Feng Lyu, Hao Wu +3
Training-free Vision-Language Navigation (VLN) agents powered by foundation models can follow instructions and explore 3D environments. However, existing approaches rely on greedy…
cs.RO2025
InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning
Ji Zhang, Shihan Wu, Xu Luo +4
Leveraging pretrained Vision-Language Models (VLMs) to map language instruction and visual observations to raw low-level actions, Vision-Language-Action models (VLAs) hold great pr…