2 papers
cs.LG2025
A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation
Jiulin Li, Ping Huang, Yexin Li +3
Real-world multimodal applications often require any-to-any capabilities, enabling both understanding and generation across modalities including text, image, audio, and video. Howe…
cs.CV2025
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
Juewen Hu, Yexin Li, Jiulin Li +2
Emotion recognition plays a vital role in enhancing human-computer interaction. In this study, we tackle the MER-SEMI challenge of the MER2025 competition by proposing a novel mult…