1 paper
Haiquan Hu, Jiazhi Jiang, Shiyou Xu +2
Evaluating large language models (LLMs) has become increasingly challenging as model capabilities advance rapidly. While recent models often achieve higher scores on standard bench…