1 paper
Junfei Xie, Peng Pan, Xulong Zhang
Multimodal Large Language Models (MLLMs) show strong performance in Visual Question Answering (VQA) but remain limited in fine-grained reasoning due to low-resolution inputs and no…