Showing cs.MMShow all
2 papers · 1 filter
cs.MM2026
SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation
Kai Peng, Yunzhe Shen, Miao Zhang +5
Audio-Visual Instance Segmentation (AVIS) aims to simultaneously classify, segment, and track sounding objects within video sequences. Unlike Audio-Visual Semantic Segmentation (AV…
cs.MM2026
Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation
Leiye Liu, Miao Zhang, Jiahong Jiang +7
Audio-visual instance segmentation (AVIS) requires accurately identifying and tracking individual sounding objects with pixel-level masks. Existing methods struggle to match overla…