1 paper · 1 filter
Ivo Kwee, Marcus Hutter, Juergen Schmidhuber
We introduce a learning method called ``gradient-based reinforcement planning'' (GREP). Unlike traditional DP methods that improve their policy backwards in time, GREP is a gradien…