5 papers
WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation
Ning Yang, Yan Huang, Kaiwen Peng +9
Visual navigation requires generating smooth and collision-free trajectories under complex geometric and physical constraints. Existing reactive policies that directly map observat…
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
Kailin Lyu, Kangyi Wu, Pengna Li +9
LLM-based agents have demonstrated impressive zero-shot performance in vision-language navigation (VLN) tasks. However, most zero-shot methods primarily rely on closed-source LLMs…
HANDO: Hierarchical Autonomous Navigation and Dexterous Omni-loco-manipulation
Jingyuan Sun, Chaoran Wang, Mingyu Zhang +6
Seamless loco-manipulation in unstructured environments requires robots to leverage autonomous exploration alongside whole-body control for physical interaction. In this work, we i…
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
Meihan Wu, Tao Chang, Cui Miao +5
Federated learning research has recently shifted from Convolutional Neural Networks (CNNs) to Vision Transformers (ViTs) due to their superior capacity. ViTs training demands highe…
FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
Cui Miao, Tao Chang, Meihan Wu +4
Vision-language-action (VLA) models have significantly advanced robotic manipulation by enabling robots to interpret language instructions for task execution. However, training the…