1 paper
Chen-Yu Wei, Christoph Dann, Julian Zimmert
We develop a model selection approach to tackle reinforcement learning with adversarial corruption in both transition and reward. For finite-horizon tabular MDPs, without prior kno…