1 paper
Alexander Vogel, Omar Moured, Yufan Chen +2
Recently, Vision Language Models (VLMs) have increasingly emphasized document visual grounding to achieve better human-computer interaction, accessibility, and detailed understandi…