2 papers
cs.SD2025
Quality-aware Masked Diffusion Transformer for Enhanced Music Generation
Chang Li, Ruoyu Wang, Lijuan Liu +7
Text-to-music (TTM) generation, which converts textual descriptions into audio, opens up innovative avenues for multimedia creation. Achieving high quality and diversity in this pr…
cs.CV2024
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
Haotian Wang, Yuzhe Weng, Yueyan Li +10
Diffusion models have revolutionized the field of talking head generation, yet still face challenges in expressiveness, controllability, and stability in long-time generation. In t…