2 papers
cs.RO2026
Bridge3D: Enabling Vision-Language-Action Models to See and Act in 3D
Haoxuan Li, Sixu Yan, Lianghui Zhu +3
Vision-Language-Action (VLA) models have demonstrated remarkable generalization in robotic manipulation via large-scale multimodal pretraining. However, VLA models are mainly train…
cs.RO2026
Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis
Sixu Yan, Shikang Wang, Binhua Huang +11
This paper proposes AdaRoboVLG, a task-adaptive Vision-Language-Grasp (VLG) framework that supports generalizable grasp synthesis across different robotic hands. Unlike existing VL…