1 paper · 1 filter
Zhichao Shi, Xuhui Jiang, Chengjin Xu +6
Current evaluation methods for large language models (LLMs) primarily rely on static benchmarks, presenting two major challenges: limited knowledge coverage and fixed difficulties…