7 papers
Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement
Nasser-Eddine Monir, Paul Magron, Romain Serizel
Conventional training losses for speech enhancement based on the signal-to-distortion ratio (SDR) treat all time-frequency (TF) regions uniformly, overlooking the fine-grained spec…
Metric Analysis for Spatial Semantic Segmentation of Sound Scenes
Mayank Mishra, Paul Magron, Romain Serizel
Spatial semantic segmentation of sound scenes (S5) consists of jointly performing audio source separation and sound event classification from a multichannel audio mixture. Evaluati…
A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization
Orane Dufour, Paul Magron, Mickael Rouvier +1
Speech anonymization is commonly evaluated using averagecase metrics such as the equal error rate, which can hide large disparities in re-identification risks across individuals. I…
The Costs of Reproducibility in Music Separation Research: a Replication of Band-Split RNN
Paul Magron, Romain Serizel, Constance Douwes
Music source separation is the task of isolating the instrumental tracks from a music song. Despite its spectacular recent progress, the trend towards more complex architectures an…
Data-independent Beamforming for End-to-end Multichannel Multi-speaker ASR
Can Cui, Paul Magron, Mostafa Sadeghi +1
Automatic speech recognition (ASR) in multichannel, multi-speaker scenarios remains challenging due to ambient noise, reverberation and overlapping speakers. In this paper, we prop…
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement
Nasser-Eddine Monir, Paul Magron, Romain Serizel
Recent advances in deep learning have significantly improved multichannel speech enhancement algorithms, yet conventional training loss functions such as the scale-invariant signal…