1 paper · 1 filter
Xiutian Zhao, Luqi Sun, Björn Schuller +1
Modern multimodal foundation models (MFMs) have made rapid progress on tasks requiring integrated perception across speech, vision, and language, including emotion recognition. How…