1 paper · 1 filter
Shezheng Song, Shasha Li, Jie Yu +6
Multimodal Large Language Models (MLLMs) have achieved remarkable progress in vision-language understanding, yet how they internally integrate visual and textual information remain…