1 paper
Siyuan Li, Xinxin Song, Chen Ruinian +5
Rubric-based reinforcement learning decomposes open-ended instructions into prompt-specific, flexible rubrics, making it better suited than reinforcement learning with verifiable r…