1 paper
Zihan Chen, Hengguang Zhou, Yuan Kang +5
Multimodal large language models (MLLMs) often struggle with fine-grained visual perception when processing complete images, as critical evidence may only appear in local regions.…