2 papers
cs.IR2026
Efficient Crawling for Scalable Web Data Acquisition (Extended Version)
Antoine Gauquier, Ioana Manolescu, Pierre Senellart
Journalistic fact-checking, as well as social or economic research, require analyzing high-quality statistics datasets (SDs, in short). However, retrieving SD corpora at scale may…
cs.DB2025
Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents
Marijan Soric, Cécile Gracianne, Ioana Manolescu +1
Table Extraction (TE) consists in extracting tables from PDF documents, in a structured format enabling automatic processing. While numerous TE tools exist, the variety of methods…