Showing cs.ROShow all
2 papers · 1 filter
cs.RO2026
GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning
Yanping Zhao, Hang Yu, Yiwei Wang +7
Vision-Language-Action (VLA) models achieve strong robotic manipulation performance but often degrade under visual and environmental shifts. Latent world modeling offers a promisin…
cs.RO2026
Learning Geometrically-Grounded 3D Visual Representations for View-Generalizable Robotic Manipulation
Di Zhang, Weicheng Duan, Dasen Gu +5
Real-world robotic manipulation demands visuomotor policies capable of robust spatial scene understanding and strong generalization across diverse camera viewpoints. While recent a…