1 paper
Mingjie Pan, Siyuan Feng, Qinglin Zhang +9
Vision-language-action (VLA) models achieve strong generalization through large-scale pre-training, but real-world deployment requires expert-level task proficiency in addition to…