collaborators
Showing cs.ROShow all

5 papers · 1 filter

cs.RO2026

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

Yuzhi Huang, Jie Wu, Weijue Bu +9

Enabling reliable long-horizon robotic manipulation is a crucial step toward open-world embodied intelligence. However, VLM-based planners treat each step as an isolated observatio…

cs.RO2026

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

Ye Li, Huanan Liu, Kangye Ji +7

Vision-Language-Action (VLA) models are a powerful paradigm for generalist robotic control. However, their high computational cost and limited control frequency hinder real-time ro…

cs.RO2026

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

Boxiang Qiu, Liliang Chen, Yue Liao +12

We introduce GE-Sim 2.0 (Genie Envisioner World Simulator 2.0), a closed-loop video world simulator for robotic manipulation. Building on the action-conditioned video generation fr…

cs.RO2026

Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning

Kangye Ji, Jianbo Zhou, Yuan Meng +3

Diffusion Policy has dominated action generation due to its strong capabilities for modeling multi-modal action distributions, but its multi-step denoising processes make it imprac…

cs.RO2025

Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning

Yijun Liu, Yuwei Liu, Yuan Meng +8

Vision-centric hierarchical embodied models have demonstrated strong potential. However, existing methods lack spatial awareness capabilities, limiting their effectiveness in bridg…