1 paper · 1 filter
Xin Guo, Xinyu Li, Renyuan Xu
This paper proposes and analyzes two new policy learning methods: regularized policy gradient (RPG) and iterative policy optimization (IPO), for a class of discounted linear-quadra…