Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
GaussianFormer3D: Multi-Modal Gaussian-based Semantic Occupancy Prediction with 3D Deformable Attention
Lingjun Zhao, Sizhe Wei, James Hays +1
3D semantic occupancy prediction is essential for achieving safe, reliable autonomous driving and robotic navigation. Compared to camera-only perception systems, multi-modal pipeli…
cs.CV2024
Dynamic Motion Synthesis: Masked Audio-Text Conditioned Spatio-Temporal Transformers
Sohan Anisetty, James Hays
Our research presents a novel motion generation framework designed to produce whole-body motion sequences conditioned on multiple modalities simultaneously, specifically text and a…
cs.CV2024
What Matters in Range View 3D Object Detection
Benjamin Wilson, Nicholas Autio Mitchell, Jhony Kaesemodel Pontes +1
Lidar-based perception pipelines rely on 3D object detection models to interpret complex scenes. While multiple representations for lidar exist, the range-view is enticing since it…