5 papers
MG-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation
Sijun Dai, Qiang Huang, Xiaoxing You +1
Retrieval-Augmented Generation (RAG) mitigates hallucinations in Multimodal Large Language Models (MLLMs), yet existing systems struggle with complex cross-modal reasoning. Flat ve…
Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
Haodong Chen, Qiang Huang, Jiaqi Zhao +3
Vision-Language Models (VLMs) are increasingly deployed in socially consequential settings, raising concerns about social bias driven by demographic cues. A central challenge in me…
Hierarchical Contrastive Learning for Multimodal Data
Huichao Li, Junhan Yu, Doudou Zhou
Multimodal representation learning is commonly built on a shared-private decomposition, treating latent information as either common to all modalities or specific to one. This bina…
When Abundance Conceals Weakness: Knowledge Conflict in Multilingual Models
Jiaqi Zhao, Qiang Huang, Haodong Chen +2
Large Language Models (LLMs) encode vast world knowledge across multiple languages, yet their internal beliefs are often unevenly distributed across linguistic spaces. When externa…
Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
Xiaoxing You, Qiang Huang, Lingyu Li +4
News image captioning aims to produce journalistically informative descriptions by combining visual content with contextual cues from associated articles. Despite recent advances,…