1 paper · 1 filter
Jingchen Sun, Shaobo Han, Ruiyi Zhang +5
Multimodal retrievers are essential for knowledge-based visual question answering, where they retrieve external evidence for image-question pairs. However, existing contrastive tra…