1 paper
Peilin Wu, Xinlu Zhang, Kun Wan +4
Rubric-based reward shaping provides interpretable and editable reward signals for fine-tuning LLMs via reinforcement learning (RL), but existing adaptive rubric methods typically…