1 paper
Yiming Zhang, Zhuokai Zhao, Zhaorun Chen +3
Self-supervised contrastive learning models, such as CLIP, have set new benchmarks for vision-language models in many downstream tasks. However, their dependency on rigid one-to-on…