4 papers
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
Zhengyao Fang, Pengyuan Lyu, Chengquan Zhang +3
Vision-language models (VLMs) face significant computational inefficiencies caused by excessive generation of visual tokens. While prior work shows that a large fraction of visual…
Prompt Tuning for CLIP on the Pretrained Manifold
Xi Yang, Yuanrong Xu, Weigang Zhang +3
Prompt tuning introduces learnable prompt vectors that adapt pretrained vision-language models to downstream tasks in a parameter-efficient manner. However, under limited supervisi…
Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases
Huanjia Zhu, Yishu Liu, Xiaozhao Fang +2
Existing Medical Visual Question Answering (Med-VQA) models often suffer from language biases, where spurious correlations between question types and answer categories are inadvert…
Enhancing Few-Shot Classification without Forgetting through Multi-Level Contrastive Constraints
Bingzhi Chen, Haoming Zhou, Yishu Liu +3
Most recent few-shot learning approaches are based on meta-learning with episodic training. However, prior studies encounter two crucial problems: (1) \textit{the presence of induc…