1 paper · 1 filter
Xingjian Zhang, Tianhong Gao, Suliang Jin +4
Large language models (LLMs) are increasingly used as raters for evaluation tasks. However, their reliability is often limited for subjective tasks, when human judgments involve su…