1 paper
Fan Yang, Mingxuan Xia, Sangzhou Xia +2
Understanding the vulnerability of large-scale pre-trained vision-language models like CLIP against adversarial attacks is key to ensuring zero-shot generalization capacity on vari…