1 paper
Jieting Long, Zewei Shi, Penghao Jiang +1
Document-based Visual Question Answering poses a challenging task between linguistic sense disambiguation and fine-grained multimodal retrieval. Although there has been encouraging…