1 paper
Haoxuan Li, Sixu Yan, Lianghui Zhu +3
Vision-Language-Action (VLA) models have demonstrated remarkable generalization in robotic manipulation via large-scale multimodal pretraining. However, VLA models are mainly train…