1 paper
Yifei Xu, Guilherme Potje, Shivam Shandilya +9
Designing aligned and robust rewards for open-ended generation remains a key barrier to RL post-training. Rubrics provide structured, interpretable supervision, but scaling rubric…