1 paper · 1 filter
Alireza Masoumian, James R. Wright
In standard RL, a learner attempts to learn an optimal policy for a Markov Decision Process whose structure (e.g. state space) is known. In online model selection, a learner attemp…