1 paper · 1 filter
Lucas Weber, Ana Bušić, Jiamin Zhu
The expected regret of any reinforcement learning algorithm is lower bounded by Ω(DXAT) for undiscounted returns, where D is the diameter of the Markov decisi…