1 paper
Chengmeng Li, Junjie Wen, Yan Peng +3
Vision-Language-Action (VLA) models excel at robotic tasks by leveraging large-scale 2D vision-language pretraining, but their reliance on RGB images limits spatial reasoning criti…