1 paper
Nishant Subramani, Alfredo Gomez, Mona Diab
Modern language models are evaluated on large benchmarks, which are difficult to make sense of, especially for model selection. Looking at the raw evaluation numbers themselves usi…