1 paper · 1 filter
Zhe Yang, Ruyi Zhang, Hongtao Chen +4
Open-vocabulary audio-visual event localization (OV-AVEL) jointly models audio-visual cues to recognize and temporally localize events, including categories unseen during training.…