2 papers
cs.CV2026
Continuous Token-Level Spatio-Temporal Context Modeling for Visual Object Tracking
Ding Xia, Meiqin Liu, Jing Zhou +1
Spatio-temporal context has become increasingly crucial for visual tracking. However, most existing approaches extract spatio-temporal cues via discrete sampling strategies, which…
cs.RO2026
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
Qiuyue Wang, Mingsheng Li, Jian Guan +37
Embodied intelligence is often studied through specialized models for individual tasks such as manipulation or navigation, resulting in fragmented capabilities and limited generali…