1 paper
Shunpeng Yang, Ben Liu, Hua Chen
Among on-policy reinforcement learning algorithms, Proximal Policy Optimization (PPO) demonstrates is widely favored for its simplicity, numerical stability, and strong empirical p…