1 paper · 1 filter
Mengyuan Sun, Yu Li, Zhuohao Yu +2
Rubric-based evaluation is a promising paradigm for judging large language model (LLM) outputs, yet self-generated rubrics lag human-annotated criteria on hard instances. We argue…