collaborators

7 papers

cs.SD2026

Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

Nasser-Eddine Monir, Paul Magron, Romain Serizel

Conventional training losses for speech enhancement based on the signal-to-distortion ratio (SDR) treat all time-frequency (TF) regions uniformly, overlooking the fine-grained spec…

cs.SD2026

Metric Analysis for Spatial Semantic Segmentation of Sound Scenes

Mayank Mishra, Paul Magron, Romain Serizel

Spatial semantic segmentation of sound scenes (S5) consists of jointly performing audio source separation and sound event classification from a multichannel audio mixture. Evaluati…

cs.SD2026

A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization

Orane Dufour, Paul Magron, Mickael Rouvier +1

Speech anonymization is commonly evaluated using averagecase metrics such as the equal error rate, which can hide large disparities in re-identification risks across individuals. I…

cs.SD2026

The Costs of Reproducibility in Music Separation Research: a Replication of Band-Split RNN

Paul Magron, Romain Serizel, Constance Douwes

Music source separation is the task of isolating the instrumental tracks from a music song. Despite its spectacular recent progress, the trend towards more complex architectures an…

cs.SD2025

Data-independent Beamforming for End-to-end Multichannel Multi-speaker ASR

Can Cui, Paul Magron, Mostafa Sadeghi +1

Automatic speech recognition (ASR) in multichannel, multi-speaker scenarios remains challenging due to ambient noise, reverberation and overlapping speakers. In this paper, we prop…

cs.SD2025

Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement

Nasser-Eddine Monir, Paul Magron, Romain Serizel

Recent advances in deep learning have significantly improved multichannel speech enhancement algorithms, yet conventional training loss functions such as the scale-invariant signal…