2 papers
cs.CV2026
PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition
Yuchen He, Jing Zhang
Referring Audio-Visual Segmentation (Ref-AVS) seeks to localize and segment target objects in video frames based on visual, auditory, and textual referring cues. The task is challe…
cs.CV2025
TFANet: Three-Stage Image-Text Feature Alignment Network for Robust Referring Image Segmentation
Qianqi Lu, Yuxiang Xie, Jing Zhang +3
Referring Image Segmentation (RIS) is a task that segments image regions based on language expressions, requiring fine-grained alignment between two modalities. However, existing m…