1 paper · 1 filter
Zhengbo Jiao, Shaobo Wang, Zifan Zhang +4
Multimodal Large Language Models (MLLMs) have significantly advanced vision-language understanding. However, even state-of-the-art models struggle with geometric reasoning, reveali…