1 paper
Matteo Papini, Giorgio Manganini, Alberto Maria Metelli +1
Importance sampling (IS) represents a fundamental technique for a large surge of off-policy reinforcement learning approaches. Policy gradient (PG) methods, in particular, signific…