10 papers · 1 filter
Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Long speech separation typically employs a segment-separation-stitch paradigm where recordings are divided into short segments, processed independently, and stitched together. Its…
Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions
Mikko Heikkinen, Archontis Politis, Konstantinos Drossos +1
Direction-of-arrival (DoA) estimation is a key component of multichannel audio processing, yet many deep learning approaches remain tied to the microphone arrays used during traini…
Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats
DÄvis Å terns, Konstantinos Drossos, Natasha Fernandes +2
Voice anonymisation aims to protect speaker identity. Currently, its empirical privacy evaluation heavily relies on the Equal Error Rate (EER). Originally designed for biometric ve…
Moving Speaker Separation via Parallel Spectral-Spatial Processing
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Multi-channel speech separation in dynamic environments is challenging as time-varying spatial and spectral features evolve at different temporal scales. Existing methods typically…
Beyond Omnidirectional: Neural Ambisonics Encoding for Arbitrary Microphone Directivity Patterns using Cross-Attention
Mikko Heikkinen, Archontis Politis, Konstantinos Drossos +1
We present a deep neural network approach for encoding microphone array signals into Ambisonics that generalizes to arbitrary microphone array configurations with fixed microphone…
Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers
Mikhail Silaev, Konstantinos Drossos, Tuomas Virtanen
Generative adversarial networks (GANs) and diffusion models have recently achieved state-of-the-art performance in audio super-resolution (ADSR), producing perceptually convincing…