6 papers
Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity
Aneri Muni, Vincent Taboga, Esther Derman +2
Tail-end risk measures such as static conditional value-at-risk (CVaR) are used in safety-critical applications to prevent rare, yet catastrophic events. Unlike risk-neutral object…
Boosting CVaR Policy Optimization with Quantile Gradients
Yudong Luo, Erick Delage
Optimizing Conditional Value-at-risk (CVaR) using policy gradient (a.k.a CVaR-PG) faces significant challenges of sample inefficiency. This inefficiency stems from the fact that it…
Risk-averse Decision Making with Contextual Information: Model, Sample Average Approximation, and Kernelization
Yuan Tao, Erick Delage, Huifu Xu
We consider risk-averse contextual optimization problems where the decision maker (DM) faces two types of uncertainties: problem data uncertainty (PDU) and contextual uncertainty (…
Actor-Critic Algorithm for Dynamic Expectile and CVaR
Yudong Luo, Erick Delage
Optimizing dynamic risk with stochastic policies is challenging in both policy updates and value learning. The former typically requires transition perturbation, while the latter m…
Epistemic Robust Offline Reinforcement Learning
Abhilash Reddy Chenreddy, Erick Delage
Offline reinforcement learning learns policies from fixed datasets without further environment interaction. A key challenge in this setting is epistemic uncertainty, arising from l…
Mitigating optimistic bias in entropic risk estimation and optimization
Utsav Sadana, Erick Delage, Angelos Georghiou
The entropic risk measure is widely used in high-stakes decision-making across economics, management science, finance, and safety-critical control systems because it captures tail…