collaborators

8 papers

cs.RO2026

Learning Transferable Dynamics Priors from Action to World Modeling

Ze Huang, Jiahui Zhang, Hairuo Liu +3

We study action-conditioned world modeling as a scalable way to learn transferable dynamics priors for robot learning. By pretraining a model to predict how actions drive visual sc…

cs.RO2026

RoboRouter: Training-Free Policy Routing for Robotic Manipulation

Yiteng Chen, Zhe Cao, Hongjia Ren +9

Research on robotic manipulation has developed a diverse set of policy paradigms, including vision-language-action (VLA) models, vision-action (VA) policies, and code-based composi…

cs.RO2026

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

Wei Xiao, Weiliang Tang, Yuying Ge +4

Human interventions provide crucial corrective signals for post-training Vision-Language-Action (VLA) models. However, enabling seamless humanoid interventions is a formidable syst…

cs.CV2026

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Jingyu Li, Zhe Liu, Dongnan Hu +10

World action models~(WAMs) have shown great promise for autonomous driving and urban navigation. Built upon Vision-Language-Action models or video generation models, existing appro…

cs.CV2026

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

Yueming Xu, Jiahui Zhang, Ze Huang +12

Despite the impressive progress on understanding and generating images shown by the recent unified architectures, the integration of 3D tasks remains challenging and largely unexpl…

cs.RO2025

Reinforcing Action Policies by Prophesying

Jiahui Zhang, Ze Huang, Chun Gu +2

Vision-Language-Action (VLA) policies excel in aligning language, perception, and robot control. However, most VLAs are trained purely by imitation, which overfits to demonstration…