1 paper · 1 filter
Yiheng Zhang, Yiming Wang, Kaiyan Zhao +3
Proximal Policy Optimization (PPO) dominates reinforcement learning and LLM alignment but relies on a "hard clipping" mechanism that discards valuable gradients. Conversely, uncons…