2 papers
cs.SD2026
Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning
Qingyu Liu, Rixi Xu, Yushen Chen +11
Zero-shot text-to-speech (TTS) can clone a speaker's voice from a short audio prompt, yet most TTS systems still require the audio prompt transcript during inference. This dependen…
cs.SD2026
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
Rixi Xu, Qingyu Liu, Haitao Li +10
In this paper, we present X-Voice, a 0.4B multilingual zero-shot voice cloning model that clones arbitrary voices and enables everyone to speak 30 languages. X-Voice is trained on…