continuous-time modeling 1latent world models 1ode-based dynamics 1robotic control 1video prediction 1
From the 1 of 4 linked papers with an AI index.
Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining
Miracle Kang, Lights Shi, Lucy Liang +10
Modern Vision-Language-Action (VLA) models must bridge pretrained vision-language reasoning and precise continuous robot control. Existing action tokenizers discretize actions prim…
cs.CV2026
SpecPL: Disentangling Spectral Granularity for Prompt Learning
Jingtao Zhou, Xirui Kang, Feiyang Huang +1
Existing prompt learning for VLMs exhibits a modality asymmetry, predominantly optimizing text tokens while still relying on frozen visual encoder as holistic extractor and neglect…