2 papers
cs.LG2026
WANDR: A Benchmark for Wide and Deep Research
Vitaliy Polshkov, Marcin Pitera, Jeremy Yang +7
WANDR (Wide ANd Deep Research) is a benchmark of 500 realistic, challenging data-collection tasks for research agents. Each task requires a system to discover a large set of entiti…
cs.LG2026
DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity
Joey Zhong, Hao Zhang, Clare Southern +7
We present DRACO (Deep Research Accuracy, Completeness, and Objectivity), a benchmark of complex deep research tasks. These tasks, which span 10 domains and draw on information sou…