9 papers
A Wavelet Diffusion GAN for Image Super-Resolution
Lorenzo Aloisi, Luigi Sigillo, Aurelio Uncini +1
In recent years, diffusion models have emerged as a superior alternative to generative adversarial networks (GANs) for high-fidelity image generation, with wide applications in tex…
Quaternion Wavelet-Conditioned Diffusion Models for Image Super-Resolution
Luigi Sigillo, Christian Bianchi, Aurelio Uncini +1
Image Super-Resolution is a fundamental problem in computer vision with broad applications spacing from medical imaging to satellite analysis. The ability to reconstruct high-resol…
Closing the Modality Gap Aligns Group-Wise Semantics
Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca +2
In multimodal learning, CLIP has been recognized as the \textit{de facto} method for learning a shared latent space across multiple modalities, placing similar representations clos…
Generative Models for Helmholtz Equation Solutions: A Dataset of Acoustic Materials
Riccardo Fosco Gramaccioni, Christian Marinoni, Fabrizio Frezza +2
Accurate simulation of wave propagation in complex acoustic materials is crucial for applications in sound design, noise control, and material engineering. Traditional numerical so…
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
Riccardo Fosco Gramaccioni, Christian Marinoni, Eleonora Grassucci +3
In this work, we present FoleyGRAM, a novel approach to video-to-audio generation that emphasizes semantic conditioning through the use of aligned multimodal encoders. Building on…
Training-Free Multimodal Guidance for Video to Audio Generation
Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti +3
Video-to-audio (V2A) generation aims to synthesize realistic and semantically aligned audio from silent videos, with potential applications in video editing, Foley sound design, an…