1 paper · 1 filter
Bo Pan, Xuan Kan, Kaitai Zhang +6
Large language models (LLMs) have become widely adopted as automated judges for evaluating AI-generated content. Despite their success, aligning LLM-based evaluations with human ju…