1 paper
Wutao Chen, Huaqin Zou, Chen Wan +1
Vision-language pre-training (VLP) models are vulnerable to adversarial examples, particularly in black-box scenarios. Existing multimodal attacks often suffer from limited perturb…