1 paper · 2 filters
Jian Li, Haojing Huang, Yujia Zhang +6
Recently, there has been significant interest in replacing the reward model in Reinforcement Learning with Human Feedback (RLHF) methods for Large Language Models (LLMs), such as D…