Showing cs.ROShow all
2 papers · 1 filter
cs.RO2026
GVLA: Geometric inductive bias for Vision-Language-Action Models
Yue Peng, Yongzhe Zhao, Artur Habuda +5
Vision-language-action (VLA) models have made rapid progress in generalist robot manipulation by harnessing semantic knowledge from pretrained vision-language backbones, but their…
cs.RO2025
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
Xiaofeng Han, Shunpeng Chen, Zenghuang Fu +9
Robot vision has greatly benefited from advancements in multimodal fusion techniques and vision-language models (VLMs). We adopt a task-oriented perspective to systematically revie…