1 citations · 1 across the 3 of their papers we have counts for
3 papers
eess.AS2024★ 1 cited
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
Xuechen Wang, Shiwan Zhao, Haoqin Sun +3
Multimodal emotion recognition (MER), leveraging speech and text, has emerged as a pivotal domain within human-computer interaction, demanding sophisticated methods for effective m…
cs.SD2024
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
Yuhang Jia, Yang Chen, Jinghua Zhao +4
Diffusion-based text-to-audio (TTA) generation has made substantial progress, leveraging latent diffusion model (LDM) to produce high-quality, diverse and instruction-relevant audi…
cs.SD2024
DiffEditor: Enhancing Speech Editing with Semantic Enrichment and Acoustic Consistency
Yang Chen, Yuhang Jia, Shiwan Zhao +4
As text-based speech editing becomes increasingly prevalent, the demand for unrestricted free-text editing continues to grow. However, existing speech editing techniques encounter…