1 paper
Sergio Rozada, Jose Luis Orejuela, Antonio G. Marques
We study the problem of learning optimal policies in finite-horizon Markov Decision Processes (MDPs) using low-rank reinforcement learning (RL) methods. In finite-horizon MDPs, the…