1 paper
Dachong Li, ZhuangZhuang Chen, Jin Zhang +1
Vision--Language--Action (VLA) models often use intermediate representations to connect multimodal inputs with continuous control, yet spatial guidance is often injected implicitly…