1 paper · 1 filter
Skyler Wu, Yash Nair, Emmanuel J. Candès
Exhaustively evaluating many large language models (LLMs) on a large suite of benchmarks is expensive. We cast benchmarking as finite-population inference and, under a fixed query…