convergence analysis 1Markov decision processes 1mirror maps 1policy mirror descent 1reinforcement learning 1
From the 1 of 3 linked papers with an AI index.
3 papers
math.OC2026
On the Policy Convergence of Policy Mirror Descent Methods
Wenye Li, Ke Wei
The paper provides a unified convergence analysis for unregularized policy mirror descent with constant step sizes in finite discounted Markov decision processes, covering a wide r…
math.OC2025
Policy Mirror Descent with Temporal Difference Learning: Sample Complexity under Online Markov Data
Wenye Li, Hongxu Chen, Jiacai Liu +1
This paper studies the policy mirror descent (PMD) method, which is a general policy optimization framework in reinforcement learning and can cover a wide range of policy gradient…
math.OC2025
On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation
Jiacai Liu, Wenye Li, Ke Wei
Policy mirror descent (PMD) is a general policy optimization framework in reinforcement learning, which can cover a wide range of typical policy optimization methods by specifying…