1 paper · 1 filter
Bo-Wen Zhang, Junwei He, Wen Wang +5
Rubric-based reinforcement learning enriches language model training by evaluating model outputs against explicit criteria. Yet in GRPO-style pipelines, these structured judgments…