2 papers
cs.RO2026
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
Zhongyu Xia, Yousen Tang, Bingqing Wei +1
Vision-Language-Action models have achieved remarkable progress in robotic manipulation, yet they suffer from a critical limitation: a lack of 3D scene understanding. This deficien…
cs.CV2026
R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection
Zhongyu Xia, Yousen Tang, Yongtao Wang +2
4D radar-camera sensing configuration has gained increasing importance in autonomous driving. However, existing 3D object detection methods that fuse 4D Radar and camera data confr…