1 paper
Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang +2
Multi-modal foundation models align images, text, and other modalities in a shared embedding space but remain vulnerable to adversarial illusions [35], where imperceptible perturba…