1 paper
Fan Liu, Tianshu Zhang, Wenwen Dai +3
Multi-modal (vision-language) models, such as CLIP, are replacing traditional supervised pre-training models (e.g., ImageNet-based pre-training) as the new generation of visual fou…