1 paper
Anisha Saha, Varsha Suresh, Teodora Kamova +3
Understanding how harm emerges from interaction between otherwise benign image-text pairs requires intent-aware cross-modal reasoning beyond surface-level features. Existing vision…