1 paper · 1 filter
Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee +1
We study fine-grained referring image segmentation via a decoupled reason-then-segment pipeline. A vision-language model (VLM) receives an image and a natural-language query, reaso…