1 paper
Saeid Asgari Taghanaki, Aliasgahr Khani, Amir Khasahmadi
Existing benchmarks for large language models (LLMs) increasingly struggle to differentiate between top-performing models, underscoring the need for more challenging evaluation fra…