1 paper
Yen-Shan Chen, Jing Jin, Peng-Ting Kuo +2
Recent studies have demonstrated that large language models (LLMs) exhibit significant biases in evaluation tasks, particularly in preferentially rating and favoring self-generated…