3 papers
cs.CV2026
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
Zhengyao Fang, Pengyuan Lyu, Chengquan Zhang +3
Vision-language models (VLMs) face significant computational inefficiencies caused by excessive generation of visual tokens. While prior work shows that a large fraction of visual…
cs.CV2026
Prompt Tuning for CLIP on the Pretrained Manifold
Xi Yang, Yuanrong Xu, Weigang Zhang +3
Prompt tuning introduces learnable prompt vectors that adapt pretrained vision-language models to downstream tasks in a parameter-efficient manner. However, under limited supervisi…
cs.CV2025
Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases
Huanjia Zhu, Yishu Liu, Xiaozhao Fang +2
Existing Medical Visual Question Answering (Med-VQA) models often suffer from language biases, where spurious correlations between question types and answer categories are inadvert…