1 paper
Tutti Chi, Letian Gao, Yixiao Zhang
While many text-to-audio systems produce monophonic or fixed-stereo outputs, generating audio with user-defined spatial properties remains a challenge. Existing deep learning-based…