1 paper · 1 filter
Xu Zhang, Longbing Cao, Zhangkai Wu
Diffusion and flow-matching based text-to-speech (TTS) models excel in naturalness but often lack explicit emotion control, as emotional signals remain entangled with speaker ident…