2 papers
cs.CV2025
Glyph: Scaling Context Windows via Visual-Text Compression
Jiale Cheng, Yusen Liu, Xinyu Zhang +11
Large language models (LLMs) increasingly rely on long-context modeling for tasks such as document understanding, code analysis, and multi-step reasoning. However, scaling context…
cs.CV2024
Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study
Yulin Fei, Yuhui Gao, Xingyuan Xian +3
With the rise of multimodal large language models, accurately extracting and understanding textual information from video content, referred to as video based optical character reco…