2 papers
cs.RO2026
GeoWorldAD: Geometry World Action Model for Autonomous Driving
Songyan Zhang, Jinyuan Tian, Hanbing Li +9
Autonomous driving requires both safe and efficient planning decisions in dynamic 3D environments. Although recent Vision/Video-Action models learn policies directly from visual ob…
cs.CV2024
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
Songyan Zhang, Wenhui Huang, Zihui Gao +2
The emergence of general human knowledge and impressive logical reasoning capacity in rapidly progressed vision-language models (VLMs) have driven increasing interest in applying V…