works on

From the 1 of 9 linked papers with an AI index.

collaborators

9 papers

cs.LG2026

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

Dongxiu Liu, Haoyi Niu, Peng Cheng +5

The paper presents ODEWorld, a continuous-time latent world model that learns a physical-time flow using ODEs to predict future states at arbitrary temporal resolutions, improving…

cs.CV2026

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

Miracle Kang, Lights Shi, Lucy Liang +10

Modern Vision-Language-Action (VLA) models must bridge pretrained vision-language reasoning and precise continuous robot control. Existing action tokenizers discretize actions prim…

cs.RO2026

Wall-OSS-0.5 Technical Report

Ryan Yu, Pushi Zhang, Starrick Liu +24

Large-scale Vision-Language-Action (VLA) pretraining is increasingly adopted as the foundation for robot policies, yet the evidence for pretrained VLAs is almost invariably reporte…

cs.CV2026

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Xinyu Wang, Mingze Li, Sicheng Lyu +6

Vision-Language-Action (VLA) models unify perception, reasoning, and control in a single policy, but their multi-billion-parameter backbones and diffusion-based action heads make o…

cs.RO2026

Demystifying Action Space Design for Robotic Manipulation Policies

Yuchun Feng, Jinliang Zheng, Zhihao Wang +5

The specification of the action space plays a pivotal role in imitation-based robotic manipulation policy learning, fundamentally shaping the optimization landscape of policy learn…

cs.RO2025

X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

Jinliang Zheng, Jianxiong Li, Zhihao Wang +12

Successful generalist Vision-Language-Action (VLA) models rely on effective training across diverse robotic platforms with large-scale, cross-embodiment, heterogeneous datasets. To…