1 paper
Anton Orell Wiehe, Nil Stolt Ansó, Madalina M. Drugan +1
In this paper, a new offline actor-critic learning algorithm is introduced: Sampled Policy Gradient (SPG). SPG samples in the action space to calculate an approximated policy gradi…