1 paper · 1 filter
Alizée Pace, Jonathan Mallinson, Eric Malmi +2
The success of reinforcement learning from human feedback (RLHF) in language model alignment is strongly dependent on the quality of the underlying reward model. In this paper, we…