1 paper
Weidong Tang, Kaiyu Li, Yikai Wang +4
Reasoning segmentation requires multimodal large language models (MLLMs) to translate implicit instructions into precise pixel-level masks. MLLMs encode an image as visual tokens,…