2 papers
cs.CV2026
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
Keishi Ishihara, Kento Sasaki, Tsubasa Takahashi +2
Vision-Language Models (VLMs) have been applied to autonomous driving to support decision-making in complex real-world scenarios. However, their training on static, web-sourced ima…
cs.CV2024
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
Hidehisa Arai, Keishi Ishihara, Tsubasa Takahashi +1
World models have emerged as promising neural simulators for autonomous driving, with the potential to supplement scarce real-world data and enable closed-loop evaluations. However…