1 paper · 1 filter
Jason R Brown, Lennie Wells, Edward James Young +1
Proximal Policy Optimisation (PPO) is an established and effective policy gradient algorithm used for Language Model Reinforcement Learning from Human Feedback (LM-RLHF). PPO perfo…