13 papers
AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild
Xiaolou Sun, Wufei Si, Wenhui Ni +10
Vision-language navigation (VLN) requires intelligent agents to navigate environments by interpreting linguistic instructions alongside visual observations, serving as a cornerston…
RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System
Runwei Guan, Rongsheng Hu, Shangshu Chen +10
Current roadside perception systems mainly focus on instance-level perception, which fall short in enabling interaction via natural language and reasoning about traffic behaviors i…
Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving
Runwei Guan, Jianan Liu, Ningwei Ouyang +8
Embodied outdoor scene understanding forms the foundation for autonomous agents to perceive, analyze, and react to dynamic driving environments. However, existing 3D understanding…
Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey
Wei Dai, Shengen Wu, Wei Wu +7
Trajectory prediction serves as a critical functionality in autonomous driving, enabling the anticipation of future motion paths for traffic participants such as vehicles and pedes…
An Overview of Algorithms for Contactless Cardiac Feature Extraction from Radar Signals: Advances and Challenges
Yuanyuan Zhang, Rui Yang, Yutao Yue +2
Contactless cardiac monitoring has vast potential to replace contact-based monitoring in various future scenarios such as smart home and in-cabin monitoring. Various contactless se…
Cognitive Disentanglement for Referring Multi-Object Tracking
Shaofeng Liang, Runwei Guan, Wangwang Lian +6
As a significant application of multi-source information fusion in intelligent transportation perception systems, Referring Multi-Object Tracking (RMOT) involves localizing and tra…