3 citations · 3 across the 3 of their papers we have counts for
4 papers · 1 filter
Closing the Modality Gap Aligns Group-Wise Semantics
Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca +2
In multimodal learning, CLIP has been recognized as the \textit{de facto} method for learning a shared latent space across multiple modalities, placing similar representations clos…
A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello
Multimodal learning plays a pivotal role in advancing artificial intelligence systems by incorporating information from multiple modalities to build a more comprehensive representa…
Training-Free Multimodal Guidance for Video to Audio Generation
Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti +3
Video-to-audio (V2A) generation aims to synthesize realistic and semantically aligned audio from silent videos, with potential applications in video editing, Foley sound design, an…
Semantic Compression via Multimodal Representation Learning
Eleonora Grassucci, Giordano Cicchetti, Aurelio Uncini +1
Multimodal representation learning produces high-dimensional embeddings that align diverse modalities in a shared latent space. While this enables strong generalization, it also in…