6 papers
SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction
Pin Tang, Zhongdao Wang, Guoqing Wang +2
Vision-based 3D semantic occupancy prediction is essential for autonomous driving, yet dense voxel representations waste computation on largely empty space, while BEV and TPV proje…
Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving
Guoqing Wang, Pin Tang, Xiangxuan Ren +2
Reconstructing 3D scene structures from sparse, low-overlap observations remains a fundamental challenge in autonomous driving. Recent state-of-the-art frameworks achieve promising…
PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
Pin Tang, Guoqing Wang, Xiangxuan Ren +4
Vision-Language-Action Models (VLAs), which leverage the advanced reasoning capabilities of Vision-Language Models (VLMs), show promising generalization in complex autonomous drivi…
Learning Vision-Language-Action World Models for Autonomous Driving
Guoqing Wang, Pin Tang, Xiangxuan Ren +3
Vision-Language-Action (VLA) models have recently achieved notable progress in end-to-end autonomous driving by integrating perception, reasoning, and control within a unified mult…
Grounding Everything in Tokens for Multimodal Large Language Models
Xiangxuan Ren, Zhongdao Wang, Liping Hou +3
Multimodal large language models (MLLMs) have made significant advancements in vision understanding and reasoning. However, the autoregressive Transformer architecture used by MLLM…
LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation
Xiangxuan Ren, Zhongdao Wang, Pin Tang +3
3D object detection is fundamental for safe and robust intelligent transportation systems. Current multi-modal 3D object detectors often rely on complex architectures and training…