1 paper · 1 filter
Viktoriia Zinkovich, Anton Antonov, Andrei Spiridonov +6
Multimodal large language models (MLLMs) have shown impressive capabilities in vision-language tasks such as reasoning segmentation, where models generate segmentation masks based…