68 citations · 206 across the 63 of their papers we have counts for
1 paper · 1 filter
Jinxing Zhou, Yanghao Zhou, Mingfei Han +4
Referring Audio-Visual Segmentation (Ref-AVS) aims to segment target objects in audible videos based on given reference expressions. Prior works typically rely on learning latent e…