2 papers
cs.CV2026
Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
Haoyu Cao, Kun Yin, Yunfei Wu +16
This paper presents Youtu-Parsing, an efficient and versatile document parsing model designed for high-performance content extraction. The architecture employs a native Vision Tran…
cs.CV2024
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
Yubo Wang, Chaohu Liu, Yanqiu Qu +3
Large vision-language models (LVLMs) integrate visual information into large language models, showcasing remarkable multi-modal conversational capabilities. However, the visual mod…