1 paper
Jiaxuan Wang, Yulan Hu, Wenjin Yang +3
In classical Reinforcement Learning from Human Feedback (RLHF), Reward Models (RMs) serve as the fundamental signal provider for model alignment. As Large Language Models evolve in…