3 papers
cs.MM2026
SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation
Kai Peng, Yunzhe Shen, Miao Zhang +5
Audio-Visual Instance Segmentation (AVIS) aims to simultaneously classify, segment, and track sounding objects within video sequences. Unlike Audio-Visual Semantic Segmentation (AV…
cs.CV2026
Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation
Kai Peng, Yunzhe Shen, Miao Zhang +6
The ability to capture and segment sounding objects in dynamic visual scenes is crucial for the development of Audio-Visual Segmentation (AVS) tasks. While significant progress has…
cs.CV2025
Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation
Yunzhe Shen, Kai Peng, Leiye Liu +5
Audio-visual segmentation (AVS) plays a critical role in multimodal machine learning by effectively integrating audio and visual cues to precisely segment objects or regions within…