1 paper · 1 filter
An-Lan Wang, Jingqun Tang, Liao Lei +10
The rapid advancements in Multimodal Large Language Models (MLLMs) have significantly enhanced capabilities in Document Understanding. However, prevailing benchmarks like DocVQA an…