1 paper
Hao Ding, Zhichuan Yang, Weijie Ge +3
Fine-grained visual reasoning in multimodal large language models (MLLMs) is bottlenecked by single-pass global image encoding: key evidence often lies in tiny objects, cluttered r…