1 paper · 1 filter
Yingjian Zhu, Xinming Wang, Kun Ding +3
Multi-modal Retrieval-Augmented Generation (RAG) has emerged as a highly effective paradigm for Knowledge-Based Visual Question Answering (KB-VQA). Despite recent advancements, pre…