Showing eess.ASShow all
2 papers · 1 filter
eess.AS2026
UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning
Hui Wang, Yifan Yang, Zeyue Tian +8
Audio generation and audio-to-text understanding remain largely separate, with diffusion models dominating high-fidelity synthesis and autoregressive (AR) language models driving c…
eess.AS2024
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
Xuechen Wang, Shiwan Zhao, Haoqin Sun +3
Multimodal emotion recognition (MER), leveraging speech and text, has emerged as a pivotal domain within human-computer interaction, demanding sophisticated methods for effective m…