1 paper · 1 filter
Tianyu Yang, Terry Ruas, Yijun Tian +3
Vision-language models (VLMs) excel at interpreting text-rich images but struggle with long, visually complex documents that demand analysis and integration of information spread a…