1 paper
Guanyu Yao, Qiucheng Wu, Yang Zhang +3
Multimodal large language models (MLLMs) have demonstrated strong capabilities on vision-and-language tasks. However, recent findings reveal an imbalance in their reasoning capabil…