1 paper
Eliya Habba, Itay Itzhak, Asaf Yehudai +5
The rapid release of both language models and benchmarks makes it increasingly costly to evaluate every model on every dataset. In practice, models are often evaluated on different…