1 paper · 1 filter
Jiajia Li, Lu Yang, Mingni Tang +4
Benchmark plays a pivotal role in assessing the advancements of large language models (LLMs). While numerous benchmarks have been proposed to evaluate LLMs' capabilities, there is…