7 citations · 12 across the 14 of their papers we have counts for
Showing cs.CLShow all
3 papers · 1 filter
cs.CL2026
D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding
Hao Zhang, Longrong Yang, Lunhao Duan +3
Multi-modal retrieval-augmented generation (RAG) is a key technique for visually rich long document understanding. Existing multi-modal RAG methods are progressively advancing towa…
cs.CL2026
Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
Yuanlei Zheng, Pei Fu, Hang Li +9
Multi-page Document Visual Question Answering requires reasoning over semantics, layouts, and visual elements in long, visually dense documents. Existing OCR-free methods face a tr…
cs.CL2026
Multimodal Fact-Level Attribution for Verifiable Reasoning
David Wan, Han Wang, Ziyang Wang +3
Multimodal large language models (MLLMs) are increasingly used for real-world tasks involving multi-step reasoning and long-form generation, where reliability requires grounding mo…