1 paper · 1 filter
Yaru Chen, Peiliang Zhang, Fei Li +4
Audio-Visual Video Parsing (AVVP) task aims to parse the event categories and occurrence times from audio and visual modalities in a given video. Existing methods usually focus on…