1 paper
Xinda Wang, Zhengxu Hou, Yangshijie Zhang +6
Although the effectiveness of Large Language Models (LLMs) as judges (LLM-as-a-judge) has been validated, their performance remains limited in open-ended tasks, particularly in sto…