collaborators

5 papers

cs.CV2026

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

Yuchen Xie, Xinyu Zhou, Kuangji Zuo +4

Embodied Visual Tracking (EVT) requires an agent to continuously follow a specified target while actively moving through dynamic environments. However, prevailing EVT paradigms pre…

cs.RO2026

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation

Tao Xu, Jiaxin Wang, Runhao Zhang +7

In robot imitation learning, influence functions provide a principled approach to quantify each demonstration's effect on robot task outcomes, yet scaling them to billion-parameter…

cs.RO2026

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qiuyue Wang, Mingsheng Li, Jian Guan +37

Embodied intelligence is often studied through specialized models for individual tasks such as manipulation or navigation, resulting in fragmented capabilities and limited generali…

cs.RO2026

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Kuangji Zuo, Gen Li, Bofan Lyu +9

Vision-Language-Action (VLA) models have recently shown strong potential for robot learning by following language instructions. However, in practice, language alone is often insuff…

cs.RO2025

A New Trajectory-Oriented Approach to Enhancing Comprehensive Crowd Navigation Performance

Xinyu Zhou, Songhao Piao, Chao Gao +1

Crowd navigation has garnered considerable research interest in recent years, especially with the proliferating application of deep reinforcement learning (DRL) techniques. Many st…