collaborators

8 papers

cs.CV2026

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

Shiyi Mu, Zichong Gu, Zhiqi Ai +2

Stereo-based 3D obstacle perception for autonomous driving is currently constrained by an imbalanced triplet: deployment cost, detection accuracy, and open-set adaptability. While…

cs.RO2026

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

Yiru Wang, Anqing Jiang, Shuo Wang +3

The integration of Vision-Language-Action (VLA) models into autonomous driving systems offers a unified framework for interpreting complex scenes and executing control commands. Ho…

cs.CV2026

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

Yiru Wang, Zichong Gu, Yu Gao +5

Vision-Language-Action (VLA) models offer promising capabilities for autonomous driving through multimodal understanding. However, their utilization in safety-critical scenarios is…

cs.CV2025

StereoDETR: Stereo-based Transformer for 3D Object Detection

Shiyi Mu, Zichong Gu, Zhiqi Ai +3

Compared to monocular 3D object detection, stereo-based 3D methods offer significantly higher accuracy but still suffer from high computational overhead and latency. The state-of-t…

cs.RO2025

AnchDrive: Bootstrapping Diffusion Policies with Hybrid Trajectory Anchors for End-to-End Driving

Jinhao Chai, Anqing Jiang, Hao Jiang +4

End-to-end multi-modal planning has become a transformative paradigm in autonomous driving, effectively addressing behavioral multi-modality and the generalization challenge in lon…

cs.CV2025

Stereo-based 3D Anomaly Object Detection for Autonomous Driving: A New Dataset and Baseline

Shiyi Mu, Zichong Gu, Hanqi Lyu +2

3D detection technology is widely used in the field of autonomous driving, with its application scenarios gradually expanding from enclosed highways to open conventional roads. For…