1 paper
Yifan Yang, Jinjia Li, Kunxi Li +7
The rapid advancement of large language models (LLMs) demands increasingly reliable evaluation, yet current centralized evaluation suffers from opacity, overfitting, and hardware-i…