1 paper · 1 filter
Inyong Koo, yeeun Seong, Minseok Son +2
Audio-visual emotion recognition (AVER) methods typically fuse utterance-level features, and even frame-level attention models seldom address the frame-rate mismatch across modalit…