1 paper
Xiuwei Chen, Quanlin Chen, Wentao Hu +8
Recent multimodal large language models (MLLMs) have made remarkable progress on fine-grained perception tasks under the "Thinking with Images" (TwI) paradigm by iteratively perfor…