3 papers
cs.DB2026
Scout: Scalable Document Extraction via Data Similarity
Yiming Lin, Chiyu Hao, Shreya Shankar +1
Extracting values from large document collections powers data analysis across many domains. Frontier LLMs extract such values accurately, but processing an entire collection with o…
cs.HC2025
Rethinking Dataset Discovery with DataScout
Rachel Lin, Bhavya Chopra, Wenjing Lin +3
Dataset Search -- the process of finding appropriate datasets for a given task -- remains a critical yet under-explored challenge in data science workflows. Assessing dataset suita…
cs.IR2025
TARGET: Benchmarking Table Retrieval for Generative Tasks
Xingyu Ji, Parker Glenn, Aditya G. Parameswaran +1
The data landscape is rich with structured data, often of high value to organizations, driving important applications in data analysis and machine learning. Recent progress in repr…