5 papers
Unified Condition-Action Modeling for Accurate One-Step Action Generation
Xinyu Zhou, Zikun Cai, Kuangji Zuo +7
Robot manipulation requires policies that are both accurate and efficient, as robot control must respond to changing observations under tight latency constraints. Recent diffusion…
USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning
Yuchen Xie, Xinyu Zhou, Kuangji Zuo +4
Embodied Visual Tracking (EVT) requires an agent to continuously follow a specified target while actively moving through dynamic environments. However, prevailing EVT paradigms pre…
ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation
Tao Xu, Jiaxin Wang, Runhao Zhang +7
In robot imitation learning, influence functions provide a principled approach to quantify each demonstration's effect on robot task outcomes, yet scaling them to billion-parameter…
Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
Kuangji Zuo, Gen Li, Bofan Lyu +9
Vision-Language-Action (VLA) models have recently shown strong potential for robot learning by following language instructions. However, in practice, language alone is often insuff…
A New Trajectory-Oriented Approach to Enhancing Comprehensive Crowd Navigation Performance
Xinyu Zhou, Songhao Piao, Chao Gao +1
Crowd navigation has garnered considerable research interest in recent years, especially with the proliferating application of deep reinforcement learning (DRL) techniques. Many st…