1 paper · 1 filter
Tao Zhang, Kehui Yao, Luyi Ma +7
Evaluating large language models (LLMs) as judges is increasingly critical for building scalable and trustworthy evaluation pipelines. We present ScalingEval, a large-scale benchma…