1 paper
Yaozhong Gan, Renye Yan, Zhe Wu +1
On-policy reinforcement learning methods, like Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO), often demand extensive data per update, leading to sa…