13 papers
Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Long speech separation typically employs a segment-separation-stitch paradigm where recordings are divided into short segments, processed independently, and stitched together. Its…
Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions
Mikko Heikkinen, Archontis Politis, Konstantinos Drossos +1
Direction-of-arrival (DoA) estimation is a key component of multichannel audio processing, yet many deep learning approaches remain tied to the microphone arrays used during traini…
Automatic Audio Equalization with Semantic Embeddings
Eloi Moliner, Vesa Välimäki, Konstantinos Drossos +1
This paper presents a data-driven approach to automatic blind equalization of audio by predicting log-mel spectral features and deriving an inverse filter. The method uses a deep n…
Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats
DÄvis Å terns, Konstantinos Drossos, Natasha Fernandes +2
Voice anonymisation aims to protect speaker identity. Currently, its empirical privacy evaluation heavily relies on the Equal Error Rate (EER). Originally designed for biometric ve…
Automatic Contextual Audio Denoising
Diep Luong, Konstantinos Drossos, Mikko Heikkinen +1
Audio context determines which sound components and sources are relevant and which can be perceived as irrelevant (noise) by listeners. For example, traffic noise is informative in…
Moving Speaker Separation via Parallel Spectral-Spatial Processing
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Multi-channel speech separation in dynamic environments is challenging as time-varying spatial and spectral features evolve at different temporal scales. Existing methods typically…