1 paper
Ruofan Hu, Shengyang Xu, Minjie Hong +5
Real-world knowledge resides in multimodal documents, necessitating retrieval-augmented generation (RAG) for accurate question answering. However, existing multimodal RAG models ar…