1 paper
Taehyun Hwang, Min-hwan Oh
We study model-based reinforcement learning (RL) for episodic Markov decision processes (MDP) whose transition probability is parametrized by an unknown transition core with featur…