2 papers
cs.RO2025
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
Xiangyi Wei, Haotian Zhang, Xinyi Cao +4
The Vision-Language-Action models (VLA) have achieved significant advances in robotic manipulation recently. However, vision-only VLA models create fundamental limitations, particu…
cs.CV2025
GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction
Tianhao Li, Yang Li, Mengtian Li +2
Accurately perceiving dynamic environments is a fundamental task for autonomous driving and robotic systems. Existing methods inadequately utilize temporal information, relying mai…