7 papers · 1 filter
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
Ching Ho Lee, Javier Nistal, Stefan Lattner +2
We study timbre transfer as an inference-time editing problem for music audio. Starting from a strong pre-trained latent diffusion model, we introduce a lightweight procedure that…
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
Marco Pasini, Stefan Lattner, George Fazekas
Efficiently representing audio signals in a compressed latent space is critical for latent generative modelling. However, existing autoencoders often force a choice between continu…
PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective
Alain Riou, Bernardo Torres, Ben Hayes +4
In this paper, we introduce PESTO, a self-supervised learning approach for single-pitch estimation using a Siamese architecture. Our model processes individual frames of a Variable…
Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
Marco Pasini, Stefan Lattner, George Fazekas
Efficiently compressing high-dimensional audio signals into a compact and informative latent space is crucial for various tasks, including generative modeling and music information…
Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures
Alain Riou, Antonin Gagneré, Gaëtan Hadjeres +2
In this paper, we tackle the task of musical stem retrieval. Given a musical mix, it consists in retrieving a stem that would fit with it, i.e., that would sound pleasant if played…
Improving Musical Accompaniment Co-creation via Diffusion Transformers
Javier Nistal, Marco Pasini, Stefan Lattner
Building upon Diff-A-Riff, a latent diffusion model for musical instrument accompaniment generation, we present a series of improvements targeting quality, diversity, inference spe…