1 paper · 1 filter
Zhiqiang Zhou, Junliang Dai, Xu ling
Multimodal large language models (MLLMs) excel at visual reasoning but rely on text-based chain-of-thought (CoT), lacking interpretable visual intermediates. Existing methods use o…