1 paper
Fengyu Xie, Yilun Zhao, Bingsen Chen +2
Rubric-based reinforcement learning extends RL beyond tasks with exact answers or rule-based verifiers by scoring responses against instance-specific criteria. However, this makes…