1 paper · 1 filter
Angen Ye, Zeyu Zhang, Boyuan Wang +3
Vision-Language-Action (VLA) models aim to unify perception, language understanding, and action generation, offering strong cross-task and cross-scene generalization with broad imp…