1 paper
Cheng Zeng, Hongming Zhang
Proximal policy optimization(PPO) has been proposed as a first-order optimization method for reinforcement learning. We should notice that an exterior penalty method is used in it.…