1 paper · 1 filter
Joonyong Park, Jerry Li
Codec-based text-to-speech (TTS) models make language-model post-training applicable to speech generation, but it remains unclear when learned perceptual predictors can serve as re…