7 papers
BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations
Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen +1
The integration of Large Language Models (LLMs) into autonomous driving has attracted growing interest for their strong reasoning and semantic understanding abilities, which are es…
AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models
Santosh Vasa, Aditi Ramadwar, Jnana Rama Krishna Darabattula +5
Training of autonomous driving systems requires extensive datasets with precise annotations to attain robust performance. Human annotations suffer from imperfections, and multiple…
Uncertainty Matters in Dynamic Gaussian Splatting for Monocular 4D Reconstruction
Fengzhi Guo, Chih-Chuan Hsu, Sihao Ding +1
Reconstructing dynamic 3D scenes from monocular input is fundamentally under-constrained, with ambiguities arising from occlusion and extreme novel views. While dynamic Gaussian Sp…
NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction
Thomas Monninger, Zihan Zhang, Steffen Staab +1
Accurate environmental representations are essential for autonomous driving, providing the foundation for safe and efficient navigation. Traditionally, high-definition (HD) maps ar…
AugMapNet: Improving Spatial Latent Structure via BEV Grid Augmentation for Enhanced Vectorized Online HD Map Construction
Thomas Monninger, Md Zafar Anwar, Stanislaw Antol +2
Autonomous driving requires understanding infrastructure elements, such as lanes and crosswalks. To navigate safely, this understanding must be derived from sensor data in real-tim…
Explanation-Driven Counterfactual Testing for Faithfulness in Vision-Language Model Explanations
Sihao Ding, Santosh Vasa, Aditi Ramadwar
Vision-Language Models (VLMs) often produce fluent Natural Language Explanations (NLEs) that sound convincing but may not reflect the causal factors driving predictions. This misma…