Showing cs.AIShow all
2 papers · 1 filter
cs.AI2001
Gradient-based Reinforcement Planning in Policy-Search Methods
Ivo Kwee, Marcus Hutter, Juergen Schmidhuber
We introduce a learning method called ``gradient-based reinforcement planning'' (GREP). Unlike traditional DP methods that improve their policy backwards in time, GREP is a gradien…
cs.AI2001
Market-Based Reinforcement Learning in Partially Observable Worlds
Ivo Kwee, Marcus Hutter, Juergen Schmidhuber
Unlike traditional reinforcement learning (RL), market-based RL is in principle applicable to worlds described by partially observable Markov Decision Processes (POMDPs), where an…