1 paper
Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash +2
Policy gradient (PG) is widely used in reinforcement learning due to its scalability and good performance. In recent years, several variance-reduced PG methods have been proposed w…