1 paper · 1 filter
Chengmeng Li, Junjie Wen, Yan Peng +3
Vision-Language-Action (VLA) models excel at robotic tasks by leveraging large-scale 2D vision-language pretraining, but their reliance on RGB images limits spatial reasoning criti…