1 paper
Xiangyu Peng, Can Qin, An Yan +4
Multimodal large language models (MLLMs) have demonstrated strong capabilities in visual understanding, yet they remain limited in complex, multi-step reasoning that requires deep…