1 paper
ShunLiang Fu, Yanxin Zhang, Yixin Xiang +2
Existing multimodal document question-answering (QA) systems predominantly rely on flat semantic retrieval, representing documents as a set of disconnected text chunks and largely…