1 paper
Marie KuneÅ¡ová, ZdenÄk HanzlÃÄek, JindÅich MatouÅ¡ek
Zero-shot multi-speaker text-to-speech (TTS) systems rely on speaker embeddings to synthesize speech in the voice of an unseen speaker, using only a short reference utterance. Whil…