2 papers
cs.LG2026
On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents
Oliver Mortensen, Mohammad Sadegh Talebi
We study risk-sensitive reinforcement learning in finite discounted MDPs, where a generative model of the MDP is assumed to be available. We consider a family or risk measures call…
cs.LG2026
Recursive Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model
Oliver Mortensen, Mohammad Sadegh Talebi
We study risk-sensitive reinforcement learning in finite discounted MDPs with recursive entropic risk measures (ERM), where the risk parameter controls the agent's risk…