1 paper
Jin Cui, Zhaoyu Pu, Botao Cai +4
Vision-Language-Action (VLA) models inherit strong semantic priors from large-scale vision-language pretraining, yet remain limited in robotic manipulation by insufficient 3D spati…