1 paper
Zijian Zhang, Xiaocheng Zhang, Yang Zhou +2
Vision Large Language Models (VLLMs) have improved multi-modal understanding and visual question answering (VQA), but still suffer from hallucinated answers. Multi-modal Retrieval-…