1 paper · 1 filter
José Ángel González, Ian Borrego Obrador, Álvaro Romo Herrero +4
Large Language Models (LLMs) remain difficult to evaluate comprehensively, particularly for languages other than English, where high-quality data is often limited. Existing benchma…