23 citations · 73 across the 30 of their papers we have counts for
3 papers · 2 filters
A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello
Multimodal learning plays a pivotal role in advancing artificial intelligence systems by incorporating information from multiple modalities to build a more comprehensive representa…
Training-Free Multimodal Guidance for Video to Audio Generation
Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti +3
Video-to-audio (V2A) generation aims to synthesize realistic and semantically aligned audio from silent videos, with potential applications in video editing, Foley sound design, an…
Semantic Compression via Multimodal Representation Learning
Eleonora Grassucci, Giordano Cicchetti, Aurelio Uncini +1
Multimodal representation learning produces high-dimensional embeddings that align diverse modalities in a shared latent space. While this enables strong generalization, it also in…