1 paper
Zhongjun Zhang, Shipra Agrawal, Ilan Lobel +2
We propose an epoch-based reinforcement learning algorithm for infinite-horizon average-cost Markov decision processes (MDPs) that leverages a partial order over a policy class. In…