1 paper · 1 filter
Jinxing Zhou, Yanghao Zhou, Mingfei Han +4
Referring Audio-Visual Segmentation (Ref-AVS) aims to segment target objects in audible videos based on given reference expressions. Prior works typically rely on learning latent e…