collaborators

10 papers

cs.CV2026

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Runwei Guan, Di Tian, Ningwei Ouyang +9

As a key capability for embodied intelligence, 3D visual grounding (3DVG) has been predominantly studied in indoor scenes with RGB-D or point-cloud inputs, while existing outdoor e…

cs.MA2026

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

Runwei Guan, Yi Zhou, Heyi Lin +12

Post-discharge clinical follow-up is critical for maintaining continuity of care and mitigating long-term health risks. However, traditional follow-up paradigms suffer from shortag…

cs.CV2026

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Tongyan Hua, Dongli Wu, Jinjing Zhu +5

Generating explicit 3D city assets from a single satellite image is important for digital twins, urban simulation, and geospatial intelligence. Unlike satellite-to-street-view synt…

cs.RO2026

Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms

Zhixiang Cao, Di Tian, Runwei Guan +11

Tactile sensing is a fundamental modality for embodied intelligence, offering unique and direct feedback on contact geometry, material properties, and interaction dynamics that rem…

cs.CV2026

WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents

Runwei Guan, Shaofeng Liang, Ningwei Ouyang +9

While autonomous navigation has achieved remarkable success in passive perception (e.g., object detection and segmentation), it remains fundamentally constrained by a void in knowl…

cs.RO2026

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

Xiaolou Sun, Wufei Si, Wenhui Ni +10

Vision-language navigation (VLN) requires intelligent agents to navigate environments by interpreting linguistic instructions alongside visual observations, serving as a cornerston…