1 paper
Yongju Jia, Jiarui Ma, Xiangxian Li +4
Pre-trained vision-language models (VLMs), such as CLIP, have demonstrated impressive capability in visual tasks, but their fine-tuning often suffers from bias in class-imbalanced…