1 paper · 1 filter
Junwon Moon, Seungbeom Kim, Yejin Lee +4
Autoregressive (AR) text-to-speech (TTS) models generate discrete speech tokens sequentially, which makes inference slow and can degrade robustness, since local errors propagate to…