1 paper
Xuekang Wang, Zhuoyuan Hao, Shuo Hou +3
Rubric-based reinforcement learning (RL) uses an LLM-as-a-Judge (LaaJ) to score model outputs according to rubrics as rewards. However, policy models may exploit latent biases in t…