collaborators

9 papers

eess.IV2026

A Wavelet Diffusion GAN for Image Super-Resolution

Lorenzo Aloisi, Luigi Sigillo, Aurelio Uncini +1

In recent years, diffusion models have emerged as a superior alternative to generative adversarial networks (GANs) for high-fidelity image generation, with wide applications in tex…

cs.CV2026

Quaternion Wavelet-Conditioned Diffusion Models for Image Super-Resolution

Luigi Sigillo, Christian Bianchi, Aurelio Uncini +1

Image Super-Resolution is a fundamental problem in computer vision with broad applications spacing from medical imaging to satellite analysis. The ability to reconstruct high-resol…

cs.LG2026

Closing the Modality Gap Aligns Group-Wise Semantics

Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca +2

In multimodal learning, CLIP has been recognized as the \textit{de facto} method for learning a shared latent space across multiple modalities, placing similar representations clos…

cs.LG2025

Generative Models for Helmholtz Equation Solutions: A Dataset of Acoustic Materials

Riccardo Fosco Gramaccioni, Christian Marinoni, Fabrizio Frezza +2

Accurate simulation of wave propagation in complex acoustic materials is crucial for applications in sound design, noise control, and material engineering. Traditional numerical so…

cs.SD2025

FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders

Riccardo Fosco Gramaccioni, Christian Marinoni, Eleonora Grassucci +3

In this work, we present FoleyGRAM, a novel approach to video-to-audio generation that emphasizes semantic conditioning through the use of aligned multimodal encoders. Building on…

cs.LG2025

Training-Free Multimodal Guidance for Video to Audio Generation

Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti +3

Video-to-audio (V2A) generation aims to synthesize realistic and semantically aligned audio from silent videos, with potential applications in video editing, Foley sound design, an…