1 paper · 1 filter
Yang Li, Jie Ma, Miguel Ballesteros +2
As large language models (LLMs) become increasingly versatile, numerous large scale benchmarks have been developed to thoroughly assess their capabilities. These benchmarks typical…