Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models
Jin Cui, Chuanchang Su, Jiayi Lu +3
Vision-language models (VLMs) remain unreliable when predictions require fine-grained visual evidence. We identify a previously overlooked cause: spectral response rigidity. Despit…
cs.CV2026
Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models
Yanbin Hu, Jin Cui, Jun Ye +4
3D scene understanding requires reasoning about entity existence, spatial layout, and object relations, yet RGB images alone often provide insufficient 3D cues. Existing 3D-VLMs co…
cs.CV2026
CAST: Collapse-Aware multi-Scale Topology Fusion for Multimodal Coreset Selection
Boran Zhao, Hetian Liu, Zhenxian Hu +3
The training of large multimodal models fundamentally relies on massive image-text datasets, which inevitably incur prohibitive computational overhead. Dataset selection offers a p…