1 paper
Runyuan Cai, Yu Lin, Yiming Wang +2
Traditional speech systems typically rely on separate, task-specific models for text-to-speech (TTS), automatic speech recognition (ASR), and voice conversion (VC), resulting in fr…