1 paper
Anna Arias-Duart, Pablo Agustin Martin-Torres, Daniel Hinjos +7
Current Large Language Models (LLMs) benchmarks are often based on open-ended or close-ended QA evaluations, avoiding the requirement of human labor. Close-ended measurements evalu…