1 paper
Yongbiao Gao, Xiangcheng Sun, Guohua Lv +2
Audio-visual video parsing (AVVP) aims to recognize audio and visual event labels with precise temporal boundaries, which is quite challenging since audio or visual modality might…