1 paper
Runwu Shi, Kai Li, Yujin Wang +8
Text-to-audio (TTA) generation aims to synthesize realistic audio that faithfully reflects natural-language descriptions. Most TTA systems adopt a two-stage latent paradigm: an aud…