33 citations
1 paper · 1 filter
Mohammad Ghavamzadeh, Yaakov Engel, Michal Valko
Policy gradient methods are reinforcement learning algorithms that adapt a parameterized policy by following a performance gradient estimate. Conventional policy gradient methods u…