paper

Reward Biased Maximum Likelihood Estimation for Learning in Constrained MDPs

arXiv:2105.13919

Abstract

We use the Reward Biased Maximum Likelihood Estimation (RBMLE) algorithm to learn optimal policies for constrained Markov Decision Processes (CMDPs). We analyze the learning regrets of RBMLE.

Under preparation. arXiv admin note: text overlap with arXiv:2011.07738

Reward Biased Maximum Likelihood Estimation for Learning in Constrained MDPs · wovepaper