1 paper · 1 filter
Renhua Ding, Xinze Zhang, Xiao Yang +1
Although vision-language pre-training (VLP) models have achieved remarkable progress on cross-modal tasks, they remain vulnerable to adversarial attacks. Using data augmentation an…