1 paper · 1 filter
Zhangbin Li, Jinxing Zhou, Jing Zhang +3
Answering questions related to audio-visual scenes, i.e., the AVQA task, is becoming increasingly popular. A critical challenge is accurately identifying and tracking sounding obje…