1 paper · 1 filter
Giacomo Frisoni, Lorenzo Molfetta, Mattia Buzzoni +1
Recent advances in training-free visual prompting, such as Set-of-Mark, have emerged as a promising direction for enhancing the grounding capabilities of multimodal language models…