1 paper · 1 filter
Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar
Audio-visual event recognition (AVER) has achieved significant performance improvements through transformer-based multimodal architectures. However, the high computational complexi…