1 paper
Tetsuro Morimura, Kazuhiro Ota, Kenshi Abe +1
Policy gradient (PG) is a reinforcement learning (RL) approach that optimizes a parameterized policy model for an expected return using gradient ascent. While PG can work well even…