1 paper
Jintao Tong, Shilin Yan, Hongwei Xue +5
Multimodal Large Language Models (MLLMs) have made remarkable progress in multimodal perception and reasoning by bridging vision and language. However, most existing MLLMs perform…