1 paper · 1 filter
Jian Hu, Jason Klein Liu, Haotian Xu +1
Reinforcement Learning from Human Feedback~(RLHF) plays a crucial role in aligning Large Language Models~(LLMs). The dominant algorithm, Proximal Policy Optimization~(PPO), employs…