2 papers
cs.SD2025
Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
Naisong Zhou, Saisamarth Rajesh Phaye, Milos Cernak +4
Diffusion-based generative models have achieved state-of-the-art performance for perceptual quality in speech enhancement (SE). However, their iterative nature requires numerous Ne…
cs.SD2025
Model as Loss: A Self-Consistent Training Paradigm
Saisamarth Rajesh Phaye, Milos Cernak, Andrew Harper
Conventional methods for speech enhancement rely on handcrafted loss functions (e.g., time or frequency domain losses) or deep feature losses (e.g., using WavLM or wav2vec), which…