2 papers
cs.SD2026
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
Deokjin Seo, Gangin Park, Kihyun Nam
We present Chatterbox-Flash, a zero-shot text-to-speech model obtained by fine-tuning a pretrained autoregressive TTS decoder into a block-diffusion decoder, enabling parallel toke…
eess.AS2025
SEED: Speaker Embedding Enhancement Diffusion Model
KiHyun Nam, Jungwoo Heo, Jee-weon Jung +4
A primary challenge when deploying speaker recognition systems in real-world applications is performance degradation caused by environmental mismatch. We propose a diffusion-based…