1 paper
Rahul Madhavan, Aurghya Maiti, Gaurav Sinha +1
We study Markov Decision Processes (MDP) wherein states correspond to causal graphs that stochastically generate rewards. In this setup, the learner's goal is to identify atomic in…