2 papers
cs.LG2026
Quantifying Ranking Uncertainty in LLM Benchmarks
Bitya Neuhof, Yuval Benjamini
Pretrained models are typically ranked on multi-task leaderboards to assess their effectiveness across diverse tasks. Rank confidence intervals were recently introduced as a method…
stat.ML2026
Rank Intervals for Leaderboards: A Hierarchical Framework for Model Evaluation
Bitya Neuhof, Yuval Benjamini
Pretrained models are often evaluated on multi-task leaderboards to measure their applicability in diverse contexts. However, current methods for aggregating performance across tas…