3 papers
cs.CV2026
Position: The Systemic Lack of Agency in Visual Reasoning
Yizhao Huang, Haoyang Chen, Shiqin Wang +6
This paper argues that a systemic lack of Agency constrains the implicit reasoning capabilities of current Vision-Language Models (VLMs). Implicit reasoning refers to the ability t…
cs.CV2026
Any2Any: Unified Arbitrary Modality Translation for Remote Sensing
Haoyang Chen, Jing Zhang, Hebaixu Wang +7
Multi-modal remote sensing imagery provides complementary observations of the same geographic scene, yet such observations are frequently incomplete in practice. Existing cross-mod…
cs.CV2026
VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing
Junyi Zong, Qingxuan Jia, Meixian Shi +5
Quality inspection in smart manufacturing requires identifying intrinsic material and surface properties beyond visible geometry, yet vision-only methods remain vulnerable to occlu…