collaborators

6 papers

cs.LG2026

Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity

Aneri Muni, Vincent Taboga, Esther Derman +2

Tail-end risk measures such as static conditional value-at-risk (CVaR) are used in safety-critical applications to prevent rare, yet catastrophic events. Unlike risk-neutral object…

cs.LG2026

Boosting CVaR Policy Optimization with Quantile Gradients

Yudong Luo, Erick Delage

Optimizing Conditional Value-at-risk (CVaR) using policy gradient (a.k.a CVaR-PG) faces significant challenges of sample inefficiency. This inefficiency stems from the fact that it…

math.OC2026

Risk-averse Decision Making with Contextual Information: Model, Sample Average Approximation, and Kernelization

Yuan Tao, Erick Delage, Huifu Xu

We consider risk-averse contextual optimization problems where the decision maker (DM) faces two types of uncertainties: problem data uncertainty (PDU) and contextual uncertainty (…

cs.LG2026

Actor-Critic Algorithm for Dynamic Expectile and CVaR

Yudong Luo, Erick Delage

Optimizing dynamic risk with stochastic policies is challenging in both policy updates and value learning. The former typically requires transition perturbation, while the latter m…

cs.LG2026

Epistemic Robust Offline Reinforcement Learning

Abhilash Reddy Chenreddy, Erick Delage

Offline reinforcement learning learns policies from fixed datasets without further environment interaction. A key challenge in this setting is epistemic uncertainty, arising from l…

math.OC2026

Mitigating optimistic bias in entropic risk estimation and optimization

Utsav Sadana, Erick Delage, Angelos Georghiou

The entropic risk measure is widely used in high-stakes decision-making across economics, management science, finance, and safety-critical control systems because it captures tail…