Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining
Miracle Kang, Lights Shi, Lucy Liang +10
Modern Vision-Language-Action (VLA) models must bridge pretrained vision-language reasoning and precise continuous robot control. Existing action tokenizers discretize actions prim…
cs.CV2025
PIG-Nav: Key Insights for Pretrained Image Goal Navigation Models
Jiansong Wan, Chengming Zhou, Jinkua Liu +14
Recent studies have explored pretrained (foundation) models for vision-based robotic navigation, aiming to achieve generalizable navigation and positive transfer across diverse env…