6 papers · 1 filter
Music Restoration via Latent Operator Optimization and Diffusion Model Priors
Michal Å vento, Eloi Moliner, Valtteri Kallinen +3
Music restoration seeks to recover a clean signal from an observed recording degraded by an unknown effect, distortion, or corruption. Existing systems often rely on paired trainin…
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
Zirui Li, Jens Edlund, Yicheng Gu +3
Text-to-speech (TTS) development is limited by scarcity of high-quality, publicly available speech data for most languages outside a few high-resource languages. We present Nord-Pa…
Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams
Zirui Li, Lauri Juvela, Mikko Kurimo
Synthesizing second-language (L2) speech is potentially highly valued for L2 language learning experience and feedback. However, due to the lack of L2 speech synthesis datasets, it…
Unsupervised Estimation of Nonlinear Audio Effects: Comparing Diffusion-Based and Adversarial approaches
Eloi Moliner, Michal Å vento, Alec Wright +3
Accurately estimating nonlinear audio effects without access to paired input-output signals remains a challenging problem. This work studies unsupervised probabilistic approaches f…
Estimation and Restoration of Unknown Nonlinear Distortion using Diffusion
Michal Å vento, Eloi Moliner, Lauri Juvela +2
The restoration of nonlinearly distorted audio signals, alongside the identification of the applied memoryless nonlinear operation, is studied. The paper focuses on the difficult b…
Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models
Alec Wright, Alistair Carson, Lauri Juvela
This paper introduces Open-Amp, a synthetic data framework for generating large-scale and diverse audio effects data. Audio effects are relevant to many musical audio processing an…