2 papers
cs.RO2026
SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance
Tengyue Jiang, Chunpu Xu, Jiayue Kang +1
Discrete action tokenization provides a compact interface for autoregressive VLA policies, but accurately recovering continuous robot actions from discrete codes remains challengin…
cs.RO2026
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
Yang Liu, Pengxiang Ding, Tengyue Jiang +10
Vision-Language-Action (VLA) models map visual observations and natural-language instructions to robot actions; however, hierarchical and autoregressive paradigms often incur archi…