7 papers
Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Long speech separation typically employs a segment-separation-stitch paradigm where recordings are divided into short segments, processed independently, and stitched together. Its…
Mixture-Constrained Max Pooling Improves Separation-Based Bird Species Classification
Yuzhu Wang, Kalle Lahtinen, Patrik Lauha +4
Bird species classification from field recordings remains challenging due to overlapping vocalizations and incomplete species labels. We study source separation as a preprocessing…
DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration
Youran Ni, Shihong Tan, Yuzhu Wang +1
Music source restoration (MSR) requires jointly addressing source unmixing and the inversion of non-linear production effects. Current methods struggle to achieve accurate target s…
DTT-BSR: GAN-based DTTNet with RoPE Transformer Enhancement for Music Source Restoration
Shihong Tan, Haoyu Wang, Youran Ni +8
Music source restoration (MSR) aims to recover unprocessed stems from mixed and mastered recordings. The challenge lies in both separating overlapping sources and reconstructing si…
Moving Speaker Separation via Parallel Spectral-Spatial Processing
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Multi-channel speech separation in dynamic environments is challenging as time-varying spatial and spectral features evolve at different temporal scales. Existing methods typically…
Multi-Utterance Speech Separation and Association Trained on Short Segments
Yuzhu Wang, Archontis Politis, Konstantinos Drossos +1
Current deep neural network (DNN) based speech separation faces a fundamental challenge -- while the models need to be trained on short segments due to computational constraints, r…