3 papers
cs.SD2025
A Conditioned UNet for Music Source Separation
Ken O'Hanlon, Basil Woods, Lin Wang +1
In this paper we propose a conditioned UNet for Music Source Separation (MSS). MSS is generally performed by multi-output neural networks, typically UNets, with each output represe…
cs.SD2025
Heterogeneous bimodal attention fusion for speech emotion recognition
Jiachen Luo, Huy Phan, Lin Wang +1
Multi-modal emotion recognition in conversations is a challenging problem due to the complex and complementary interactions between different modalities. Audio and textual cues are…
cs.SD2025
Bimodal Connection Attention Fusion for Speech Emotion Recognition
Jiachen Luo, Huy Phan, Lin Wang +1
Multi-modal emotion recognition is challenging due to the difficulty of extracting features that capture subtle emotional differences. Understanding multi-modal interactions and co…