1 paper · 1 filter
Haoqian Kang, Liupeng Li, Kuofeng Gao +5
Reasoning in Multimodal Large Language Models (MLLMs) requires both fine-grained visual perception and rigorous logical deduction. Explicit text-based Chain-of-Thought (CoT) is com…