21 citations · 21 across the 6 of their papers we have counts for
1 paper · 1 filter
Zhongjun Zhang, Shipra Agrawal, Ilan Lobel +2
We propose an epoch-based reinforcement learning algorithm for infinite-horizon average-cost Markov decision processes (MDPs) that leverages a partial order over a policy class. In…