2 papers
cs.GT2026
Dynamic Programming for Epistemic Uncertainty in Markov Decision Processes
Axel Benyamine, Julien Grand-Clément, Julien Grand-Clément +3
In this paper, we propose a general theory of ambiguity-averse MDPs, which treats the uncertain transition probabilities as random variables and evaluates a policy via a risk measu…
cs.LG2024
Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis
Jia Lin Hau, Erick Delage, Esther Derman +2
In Markov decision processes (MDPs), quantile risk measures such as Value-at-Risk are a standard metric for modeling RL agents' preferences for certain outcomes. This paper propose…