3 papers
cs.RO2026
A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models
Haoyu Zhang, Yuwei Wu, Jin Chen +6
Vision-language-action (VLA) models predict sequential actions to execute tasks specified by language instructions, conditioned on visual observations and proprioceptive states. Ho…
cs.CV2026
Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification
Haoyu Zhang, Yuwei Wu, Pengxiang Li +6
In the era of Vision-Language Models (VLMs), enhancing multimodal reasoning capabilities remains a critical challenge, particularly in handling ambiguous or complex visual inputs,…
cs.RO2026
Depth-PC: A Visual Servo Framework Integrated with Cross-Modality Fusion for Sim2Real Transfer
Haoyu Zhang, Yang Liu, Yimu Jiang +2
Visual servoing techniques guide robotic motion using visual information to accomplish manipulation tasks, requiring high precision and robustness against noise. Traditional method…