1 paper
Tiantian Geng, Teng Wang, Jinming Duan +2
Existing audio-visual event localization (AVE) handles manually trimmed videos with only a single instance in each of them. However, this setting is unrealistic as natural videos o…