1 paper
Feiyang Han, Yimin Wei, Zhaofeng Liu +1
Reinforcement Learning from Human Feedback (RLHF) has played a crucial role in the success of large models such as ChatGPT. RLHF is a reinforcement learning framework which combine…