1 paper
Maoqi Liu, Junwei He, Bowen Zhang +5
Rubric-based reinforcement learning (Rubric-RL) trains language models where no verifier exists. A judge checks each criterion of a rubric, and the verdicts are aggregated into a r…