4 papers
INHerit-SG: Incremental Hierarchical Semantic Scene Graphs with RAG-Style Retrieval
YukTungSamuel Fang, Zhikang Shi, Jiabin Qiu +5
Driven by recent advancements in foundation models, semantic scene graphs have emerged as a promising paradigm for high-level 3D environmental abstraction in robot navigation. Howe…
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
Shaoqi Dong, Chaoyou Fu, Haihan Gao +12
Vision-Language Action (VLA) models significantly advance robotic manipulation by leveraging the strong perception capabilities of pretrained vision-language models (VLMs). By inte…
SEA: Semantic Map Prediction for Active Exploration of Uncertain Areas
Hongyu Ding, Xinyue Liang, Yudong Fang +7
In this paper, we propose SEA, a novel approach for active robot exploration through semantic map prediction and a reinforcement learning-based hierarchical exploration policy. Unl…
LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments
Hongyu Ding, Ziming Xu, Yudong Fang +6
LaViRA: Zero-shot Vision-and-Language Navigation in Continuous Environments (VLN-CE) requires an agent to navigate unseen environments based on natural language instructions withou…