5 papers
SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction
Pin Tang, Zhongdao Wang, Guoqing Wang +2
Vision-based 3D semantic occupancy prediction is essential for autonomous driving, yet dense voxel representations waste computation on largely empty space, while BEV and TPV proje…
PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
Pin Tang, Guoqing Wang, Xiangxuan Ren +4
Vision-Language-Action Models (VLAs), which leverage the advanced reasoning capabilities of Vision-Language Models (VLMs), show promising generalization in complex autonomous drivi…
Grounding Everything in Tokens for Multimodal Large Language Models
Xiangxuan Ren, Zhongdao Wang, Liping Hou +3
Multimodal large language models (MLLMs) have made significant advancements in vision understanding and reasoning. However, the autoregressive Transformer architecture used by MLLM…
LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation
Xiangxuan Ren, Zhongdao Wang, Pin Tang +3
3D object detection is fundamental for safe and robust intelligent transportation systems. Current multi-modal 3D object detectors often rely on complex architectures and training…
Offboard Occupancy Refinement with Hybrid Propagation for Autonomous Driving
Hao Shi, Song Wang, Jiaming Zhang +5
Vision-based occupancy prediction, also known as 3D Semantic Scene Completion (SSC), presents a significant challenge in computer vision. Previous methods, confined to onboard proc…