1 paper
Bradley Burega, John D. Martin, Luke Kapeluck +1
We study how a Reinforcement Learning (RL) system can remain sample-efficient when learning from an imperfect model of the environment. This is particularly challenging when the le…