1 paper
Jingyi He, Sanghwan Kim, Zeynep Akata
Multimodal large language models (MLLMs) struggle with fine-grained Visual Search, the task of locating small or rare objects in high-resolution images. Existing remedies fall into…