1 paper
Baoli Zhang, Haining Xie, Pengfan Du +6
The unprecedented performance of large language models (LLMs) requires comprehensive and accurate evaluation. We argue that for LLMs evaluation, benchmarks need to be comprehensive…