3 papers
cs.CV2025
From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection
Lincan Cai, Jingxuan Kang, Shuang Li +4
Pretrained vision-language models (VLMs), e.g., CLIP, demonstrate impressive zero-shot capabilities on downstream tasks. Prior research highlights the crucial role of visual augmen…
cs.CV2024
Learning Modality Knowledge Alignment for Cross-Modality Transfer
Wenxuan Ma, Shuang Li, Lincan Cai +1
Cross-modality transfer aims to leverage large pretrained models to complete tasks that may not belong to the modality of pretraining data. Existing works achieve certain success i…
cs.CV2024
Enhancing Cross-Modal Fine-Tuning with Gradually Intermediate Modality Generation
Lincan Cai, Shuang Li, Wenxuan Ma +4
Large-scale pretrained models have proven immensely valuable in handling data-intensive modalities like text and image. However, fine-tuning these models for certain specialized mo…