3 papers
cs.CV2026
Manboformer: Learning Gaussian Representations via Spatial-temporal Attention Mechanism
Ziyue Zhao, Qining Qi, Jianfa Ma
Compared with voxel-based grid prediction, in the field of 3D semantic occupation prediction for autonomous driving, GaussianFormer proposed using 3D Gaussian to describe scenes wi…
cs.RO2026
HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model
Dongting Li, Xingyu Chen, Qianyang Wu +10
Humanoid robots show promise for complex whole-body tasks in unstructured environments. Although Human-Object Interaction (HOI) has advanced, most methods focus on fully actuated o…
cs.RO2026
AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation
Xuecheng Chen, Zongzhuo Liu, Jianfa Ma +4
Recent advances in large Vision-Language Models (VLMs) have provided rich semantic understanding that empowers drones to search for open-set objects via natural language instructio…