2 papers
cs.RO2026
Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving
Yun Li, Yidu Zhang, Simon Thompson +2
Vision-Language-Action (VLA) models for autonomous driving must integrate diverse textual inputs, including navigation commands, hazard warnings, and traffic state descriptions, ye…
cs.CV2025
Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning
Rui Zhao, Qirui Yuan, Jinyu Li +4
End-to-end autonomous driving, which directly maps raw sensor inputs to low-level vehicle controls, is an important part of Embodied AI. Despite successes in applying Multimodal La…