1 paper
Deokjin Seo, Gangin Park, Kihyun Nam
We present Chatterbox-Flash, a zero-shot text-to-speech model obtained by fine-tuning a pretrained autoregressive TTS decoder into a block-diffusion decoder, enabling parallel toke…