1 paper
Huilai Li, Xiaomeng Di, Ying Xing +3
Weakly supervised Audio-Visual Video Parsing (AVVP) aims to recognize and temporally localize audio, visual, and audio-visual events in videos using only coarse-grained labels. Fac…