1 paper · 1 filter
Le Xiang, Zhicheng Guan, Hong Chen +5
Long Document Visual Question Answering (LongDocVQA) requires Multimodal Large Language Models (MLLMs) to locate, integrate, and reason over heterogeneous document elements distrib…