Showing cs.IRShow all
2 papers · 1 filter
cs.IR2025
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
Kuicai Dong, Yujing Chang, Shijie Huang +3
Document Visual Question Answering (DocVQA) faces dual challenges in processing lengthy multimodal documents (text, images, tables) and performing cross-modal reasoning. Current do…
cs.IR2025
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
Kuicai Dong, Yujing Chang, Xin Deik Goh +3
Multimodal document retrieval aims to identify and retrieve various forms of multimodal content, such as figures, tables, charts, and layout information from extensive documents. D…