collaborators

5 papers

cs.IR2026

MG-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

Sijun Dai, Qiang Huang, Xiaoxing You +1

Retrieval-Augmented Generation (RAG) mitigates hallucinations in Multimodal Large Language Models (MLLMs), yet existing systems struggle with complex cross-modal reasoning. Flat ve…

cs.CV2026

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

Haodong Chen, Qiang Huang, Jiaqi Zhao +3

Vision-Language Models (VLMs) are increasingly deployed in socially consequential settings, raising concerns about social bias driven by demographic cues. A central challenge in me…

stat.ML2026

Hierarchical Contrastive Learning for Multimodal Data

Huichao Li, Junhan Yu, Doudou Zhou

Multimodal representation learning is commonly built on a shared-private decomposition, treating latent information as either common to all modalities or specific to one. This bina…

cs.CL2026

When Abundance Conceals Weakness: Knowledge Conflict in Multilingual Models

Jiaqi Zhao, Qiang Huang, Haodong Chen +2

Large Language Models (LLMs) encode vast world knowledge across multiple languages, yet their internal beliefs are often unevenly distributed across linguistic spaces. When externa…

cs.CV2025

Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning

Xiaoxing You, Qiang Huang, Lingyu Li +4

News image captioning aims to produce journalistically informative descriptions by combining visual content with contextual cues from associated articles. Despite recent advances,…