2 papers
cs.IR2026
DocPC: Document-Level Visual Retrieval via Representative Page Composition
Chengsong You, Qiyi Jiang, Junwei Zhou +12
Visual document retrieval has advanced by encoding page screenshots with vision-language models, bypassing OCR pipelines. However, existing methods remain page-centric, misaligned…
cs.AI2026
Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression
Cheng Fan, Junyi Zhou, Tingzhang Luo +5
Multi-step language-model agents repeatedly process growing interaction histories, leading to substantial context costs. Vision--text compression reduces these costs by rendering h…