1 paper
Ayako Sato, Hwichan Kim, Zhousi Chen +2
"LLM-as-a-judge," which utilizes large language models (LLMs) as evaluators, has proven effective in many evaluation tasks. However, evaluator LLMs exhibit numerical bias, a phenom…