1 paper · 1 filter
Souradip Chakraborty, Jiahao Qiu, Hui Yuan +5
Reinforcement Learning from Human Feedback (RLHF) aligns language models to human preferences by employing a singular reward model derived from preference data. However, such an ap…