1 paper
Angen Ye, Zeyu Zhang, Boyuan Wang +3
Vision-Language-Action (VLA) models aim to unify perception, language understanding, and action generation, offering strong cross-task and cross-scene generalization with broad imp…