3 papers
cs.MM2024
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
Mao-Kui He, Jun Du, Shu-Tong Niu +2
In this paper, we propose a quality-aware end-to-end audio-visual neural speaker diarization framework, which comprises three key techniques. First, our audio-visual model takes bo…
eess.AS2024
A Variance-Preserving Interpolation Approach for Diffusion Models with Applications to Single Channel Speech Enhancement and Recognition
Zilu Guo, Qing Wang, Jun Du +3
In this paper, we propose a variance-preserving interpolation framework to improve diffusion models for single-channel speech enhancement (SE) and automatic speech recognition (ASR…
cs.SD2021
Information Fusion in Attention Networks Using Adaptive and Multi-level Factorized Bilinear Pooling for Audio-visual Emotion Recognition
Hengshun Zhou, Jun Du, Yuanyuan Zhang +3
Multimodal emotion recognition is a challenging task in emotion computing as it is quite difficult to extract discriminative features to identify the subtle differences in human em…