2 papers
cs.CV2026
Text-Guided Visual Dependency Graph Learning with Cross-Modal Attention Priors
Fei Wang, Yutong Zhang, Yang Ye +3
Estimating interpretable conditional-dependence structures from multimodal visual-linguistic features remains largely unexplored. We propose CM-GLasso (Cross-Modal Graphical Lasso)…
cs.CV2025
Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
Shuo Yang, Yuwei Niu, Yuyang Liu +3
Multimodal Large Language Models (MLLMs) have achieved remarkable progress in multimodal reasoning. However, they often excessively rely on textual information during the later sta…