3 papers
cs.RO2026
SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies
Dijia Zhan, Xuemiao Xu, Jinyi Li +1
Vision-Language-Action (VLA) policies that execute fixed-length action chunks can exhibit multimodal bifurcation: a cross-chunk inconsistency in which adjacent chunks generated fro…
cs.CV2026
NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps
Dijia Zhan, Jinyi Li, Chenxi Zheng +4
Existing Vision-Language Navigation (VLN) methods typically adopt an egocentric, step-by-step paradigm, which struggles with error accumulation and limits efficiency. While recent…
cs.CV2026
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
Chaohong Guo, Yihan He, Yongwei Nie +3
Video Temporal Grounding (VTG) aims to localize the video segment that corresponds to a natural language query, which requires a comprehensive understanding of complex temporal dyn…