1 paper · 1 filter
Weidong Tang, Kaiyu Li, Yikai Wang +4
Reasoning segmentation requires multimodal large language models (MLLMs) to translate implicit instructions into precise pixel-level masks. MLLMs encode an image as visual tokens,…