1 paper · 1 filter
Peiru Yang, Jinhua Yin, Haoran Zheng +7
Multimodal retrieval-augmented generation (RAG) systems enhance large vision-language models by integrating cross-modal knowledge, enabling their increasing adoption across real-wo…