1 paper · 1 filter
Can Lv, Mingju Chen, Heng Chang +1
Rubric-based rewards are increasingly used for open-ended language model post-training, but criterion-level scores are often aggregated as independent utilities. This flat scalariz…