5 papers
RegTrack: Simplicity Beneath Complexity in Robust Multi-Modal 3D Multi-Object Tracking
Lipeng Gu, Xuefeng Yan, Song Wang +1
Existing 3D multi-object tracking (MOT) methods often sacrifice efficiency and generalizability for robustness, largely relying on complex association metrics derived from multi-mo…
AlignFreeNet: Is Cross-Modal Pre-Alignment Necessary? An End-to-End Alignment-Free Lightweight Network for Visible-Infrared Object Detection
Dingkun Zhu, Haote Zhang, Lipeng Gu +7
Cross-modal misalignments, such as spatial offsets, resolution discrepancies, and semantic deficiencies, frequently occur in visible-infrared object detection (VI-OD). To mitigate…
I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs
Yu Qi, Lipeng Gu, Honghua Chen +2
Existing 3D visual grounding methods rely on precise text prompts to locate objects within 3D scenes. Speech, as a natural and intuitive modality, offers a promising alternative. R…
Unified Representation Space for 3D Visual Grounding
Yinuo Zheng, Lipeng Gu, Honghua Chen +2
3D visual grounding (3DVG) is a critical task in scene understanding that aims to identify objects in 3D scenes based on text descriptions. However, existing methods rely on separa…
CrossTracker: Robust Multi-modal 3D Multi-Object Tracking via Cross Correction
Lipeng Gu, Xuefeng Yan, Weiming Wang +4
The fusion of camera- and LiDAR-based detections offers a promising solution to mitigate tracking failures in 3D multi-object tracking (MOT). However, existing methods predominantl…