1 paper · 1 filter
Yongjoo Kim, Mincheol Kwon, Seonga Choi +5
Dense document images often contain many fine-grained visual and textual entities whose relevance depends on a user query. Standard vision-language retrievers encode cropped region…