1 paper
Cathy Wu, Aravind Rajeswaran, Yan Duan +5
Policy gradient methods have enjoyed great success in deep reinforcement learning but suffer from high variance of gradient estimates. The high variance problem is particularly exa…