1 paper · 1 filter
Pengcheng Pan, Xinfang Zhang
Multimodal large language models (MLLMs) can miss fine details in a full image that they recognize in a closer view. Recovering this evidence requires deciding where to look and ho…