Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Multimodal OCR: Parse Anything from Documents
Handong Zheng, Yumeng Li, Kaile Zhang +22
We present Multimodal OCR (MOCR), a document parsing paradigm that jointly parses text and graphics into unified textual representations. Unlike conventional OCR systems that focus…
cs.CV2024
Hierarchical Side-Tuning for Vision Transformers
Weifeng Lin, Ziheng Wu, Wentao Yang +3
Fine-tuning pre-trained Vision Transformers (ViTs) has showcased significant promise in enhancing visual recognition tasks. Yet, the demand for individualized and comprehensive fin…