1 paper · 1 filter
Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam +2
Multimodal foundation models that integrate audio, vision, and language achieve strong performance on reasoning and generation tasks, yet their robustness to adversarial manipulati…