1 paper · 1 filter
Chengzhi Li, Heyan Huang, Ping Jian +1
Audio-Visual Semantic Segmentation (AVSS) aligns audio and video at the pixel level but requires costly per-frame annotations. We introduce Weakly Supervised Audio-Visual Semantic…