2 papers
cs.CV2026
Beyond String Matching: Semantic Evaluation of PDF Table Extraction
Pius Horn, Janis Keuper
Reliably extracting tables from PDFs is essential for large-scale scientific data mining and knowledge base construction, yet existing evaluation approaches rely on rule-based metr…
cs.CV2026
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
Pius Horn, Janis Keuper
Correctly parsing mathematical formulas from PDFs is critical for training large language models and building scientific knowledge bases from academic literature, yet existing benc…