embodied generation 1embodied video generation 1multimodal foundation models 1multi-view consistency 1robotic scene synthesis 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.RO2026
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
Xinghang Li, Jun Guo, Qiwei Li +21
The paper introduces Xiaomi-Robotics-U0, a 38‑billion‑parameter multimodal autoregressive model that extends foundation image and video generation to embodied robotics, enabling co…
cs.RO2026
ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation
Hongyu Yan, Qiwei Li, Jiaolong Yang +1
Most existing vision-language-action (VLA) models for robotic manipulation lack progress awareness, typically relying on hand-crafted heuristics for task termination. This limitati…
cs.CV2026
FlowSSC: Universal Generative Monocular Semantic Scene Completion via One-Step Latent Diffusion
Zichen Xi, Hao-Xiang Chen, Nan Xue +5
Semantic Scene Completion (SSC) from monocular RGB images is a fundamental yet challenging task due to the inherent ambiguity of inferring occluded 3D geometry from a single view.…