5 papers
MG-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation
Sijun Dai, Qiang Huang, Xiaoxing You +1
Retrieval-Augmented Generation (RAG) mitigates hallucinations in Multimodal Large Language Models (MLLMs), yet existing systems struggle with complex cross-modal reasoning. Flat ve…
LLMs Should Incorporate Explicit Mechanisms for Human Empathy
Xiaoxing You, Qiang Huang, Jun Yu
This paper argues that Large Language Models (LLMs) should incorporate explicit mechanisms for human empathy. As LLMs become increasingly deployed in high-stakes human-centered set…
Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events
Xiaoxing You, Qiang Huang, Lingyu Li +2
Multimodal Summarization (MMS) aims to generate concise textual summaries by understanding and integrating information across videos, transcripts, and images. However, existing app…
When Abundance Conceals Weakness: Knowledge Conflict in Multilingual Models
Jiaqi Zhao, Qiang Huang, Haodong Chen +2
Large Language Models (LLMs) encode vast world knowledge across multiple languages, yet their internal beliefs are often unevenly distributed across linguistic spaces. When externa…
Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
Xiaoxing You, Qiang Huang, Lingyu Li +4
News image captioning aims to produce journalistically informative descriptions by combining visual content with contextual cues from associated articles. Despite recent advances,…