1 paper
Zonghe Liu, Shanyuan Jie, Xiaoquan Sun +4
Vision-Language-Action (VLA) models have shown strong potential for general robot manipulation, but most existing models rely on 2D visual-language backbones and lack fine-grained…