1 paper
Matteo Papini, Damiano Binaghi, Giuseppe Canonaco +2
In this paper, we propose a novel reinforcement- learning algorithm consisting in a stochastic variance-reduced version of policy gradient for solving Markov Decision Processes (MD…