1 paper · 1 filter
Yiwen Jiang, Deval Mehta, Siyuan Yan +3
Multimodal Large Language Models (MLLMs) have shown promise in visual-textual reasoning, with Multimodal Chain-of-Thought (MCoT) prompting significantly enhancing interpretability.…