1 paper · 1 filter
Riccardo Lunardi, Vincenzo Della Mea, Stefano Mizzaro +1
Large Language Models (LLMs) effectiveness is usually evaluated by means of benchmarks such as MMLU, ARC-C, or HellaSwag, where questions are presented in their original wording, t…