1 paper
Yinghao Aaron Li, Xilin Jiang, Fei Tao +4
Diffusion-based text-to-speech (TTS) systems have made remarkable progress in zero-shot speech synthesis, yet optimizing all components for perceptual metrics remains challenging.…