1 paper · 1 filter
Muntasir Wahed, Kiet A. Nguyen, Adheesh Sunil Juvekar +6
Despite significant advancements in Large Vision-Language Models (LVLMs)' capabilities, existing pixel-grounding models operate in single-image settings, limiting their ability to…