1 paper
Tianci Gao, Konstantin A. Neusypin, Dmitry D. Dmitriev +2
Proximal Policy Optimization (PPO) is widely used in continuous control due to its robustness and stable training, yet it remains sample-inefficient in tasks with expensive interac…