8 papers
Learning Transferable Dynamics Priors from Action to World Modeling
Ze Huang, Jiahui Zhang, Hairuo Liu +3
We study action-conditioned world modeling as a scalable way to learn transferable dynamics priors for robot learning. By pretraining a model to predict how actions drive visual sc…
RoboRouter: Training-Free Policy Routing for Robotic Manipulation
Yiteng Chen, Zhe Cao, Hongjia Ren +9
Research on robotic manipulation has developed a diverse set of policy paradigms, including vision-language-action (VLA) models, vision-action (VA) policies, and code-based composi…
ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning
Wei Xiao, Weiliang Tang, Yuying Ge +4
Human interventions provide crucial corrective signals for post-training Vision-Language-Action (VLA) models. However, enabling seamless humanoid interventions is a formidable syst…
Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation
Jingyu Li, Zhe Liu, Dongnan Hu +10
World action models~(WAMs) have shown great promise for autonomous driving and urban navigation. Built upon Vision-Language-Action models or video generation models, existing appro…
UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
Yueming Xu, Jiahui Zhang, Ze Huang +12
Despite the impressive progress on understanding and generating images shown by the recent unified architectures, the integration of 3D tasks remains challenging and largely unexpl…
Reinforcing Action Policies by Prophesying
Jiahui Zhang, Ze Huang, Chun Gu +2
Vision-Language-Action (VLA) policies excel in aligning language, perception, and robot control. However, most VLAs are trained purely by imitation, which overfits to demonstration…