1 paper
Zhiyuan Gao, Di Wen, Yanxiang Zhan +4
Vision-language-action (VLA) models built on pretrained vision-language models have demonstrated strong performance across diverse robotic manipulation tasks. However, VLA models t…