2 papers
cs.CV2026
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7
Vision-language models improve perception by feeding increasingly long visual token sequences into language backbones, but the resulting inference cost raises a basic scaling quest…
cs.CV2025
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
Wenhui Liao, Jiapeng Wang, Hongliang Li +3
Text-rich document understanding (TDU) requires comprehensive analysis of documents containing substantial textual content and complex layouts. While Multimodal Large Language Mode…