2 papers
cs.CV2026
Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models
Huafu Li, Guo Chen, Jia Xia +5
Visual information extraction (VIE) from visually rich documents remains challenging due to high layout variability and real-world impairments. Existing methods typically rely on s…
cs.CL2025
Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models
NVIDIA, :, Aaron Blakeman +198
As inference-time scaling becomes critical for enhanced reasoning capabilities, it is increasingly becoming important to build models that are efficient to infer. We introduce Nemo…