1 paper · 1 filter
Chao Yi, Lu Ren, De-Chuan Zhan +1
CLIP showcases exceptional cross-modal matching capabilities due to its training on image-text contrastive learning tasks. However, without specific optimization for unimodal scena…