1 paper · 2 filters
Tong Shi, Xuri Ge, Joemon M. Jose +2
Capturing complex temporal relationships between video and audio modalities is vital for Audio-Visual Emotion Recognition (AVER). However, existing methods lack attention to local…