2 papers
cs.CV2026
LARA: Latent Action Representation Alignment for Vision-Language-Action Models
Mengya Liu, Baoxiong Jia, Jiangyong Huang +2
Visual-language action (VLA) models enable robots to predict actions directly from observations and language instructions, but their performance depends on large-scale, high-qualit…
cs.CV2025
Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
Zan Wang, Jingze Zhang, Yixin Chen +3
Despite significant advancements in human motion generation, current motion representations, typically formulated as discrete frame sequences, still face two critical limitations:…