7 papers
ReferTrack: Referring Then Tracking for Embodied Visual Tracking
Hanjing Ye, Tianle Zeng, Jiazhao Zhang +6
Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-languag…
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
Jiahang Liu, Yuanxing Duan, Jiazhao Zhang +4
Simulating realistic environments for robots is widely recognized as a critical challenge in robot learning, particularly in terms of rendering and physical simulation. This challe…
Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning
Zixuan Wang, Huang Fang, Shaoan Wang +4
While large vision-language models (VLMs) show promise for object goal navigation, current methods still struggle with low success rates and inefficient localization of unseen obje…
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
Jiahang Liu, Yunpeng Qi, Jiazhao Zhang +9
Embodied Visual Tracking (EVT) is a fundamental ability that underpins practical applications, such as companion robots, guidance robots and service assistants, where continuously…
Embodied Navigation Foundation Model
Jiazhao Zhang, Anqi Li, Yunpeng Qi +14
Navigation is a fundamental capability in embodied AI, representing the intelligence required to perceive and interact within physical environments following language instructions.…
TrackVLA: Embodied Visual Tracking in the Wild
Shaoan Wang, Jiazhao Zhang, Minghan Li +7
Embodied visual tracking is a fundamental skill in Embodied AI, enabling an agent to follow a specific target in dynamic environments using only egocentric vision. This task is inh…