1 paper · 1 filter
Xinlei Niu, Jing Zhang, Christian Walder +1
We present SoundLoCD, a novel text-to-sound generation framework, which incorporates a LoRA-based conditional discrete contrastive latent diffusion model. Unlike recent large-scale…