Distributional Actor-Critic Ensemble for Uncertainty-Aware Continuous Control
arXiv:2207.13730 · doi:10.1109/IJCNN55064.2022.9892771
Abstract
Uncertainty quantification is one of the central challenges for machine learning in real-world applications. In reinforcement learning, an agent confronts two kinds of uncertainty, called epistemic uncertainty and aleatoric uncertainty. Disentangling and evaluating these uncertainties simultaneously stands a chance of improving the agent's final performance, accelerating training, and facilitating quality assurance after deployment. In this work, we propose an uncertainty-aware reinforcement learning algorithm for continuous control tasks that extends the Deep Deterministic Policy Gradient algorithm (DDPG). It exploits epistemic uncertainty to accelerate exploration and aleatoric uncertainty to learn a risk-sensitive policy. We conduct numerical experiments showing that our variant of DDPG outperforms vanilla DDPG without uncertainty estimation in benchmark tasks on robotic control and power-grid optimization.
10 pages, 6 figures. Accepted to International Joint Conference on Neural Networks (IJCNN 2022), July 18-23, Padua, Italy
References in corpus (12)
- A Review of Uncertainty Quantification in Deep Learning: Techniques, Applications and Challenges
- UCB Exploration via Q-Ensembles
- Controlling Overestimation Bias with Truncated Mixture of Continuous Distributional Quantile Critics
- Parametric Return Density Estimation for Reinforcement Learning
- Worst Cases Policy Gradients
- Learning to Run with Actor-Critic Ensemble
- Risk-Averse Offline Reinforcement Learning
- PowerGym: A Reinforcement Learning Environment for Volt-Var Control in Power Distribution Systems
- Improving Robustness via Risk Averse Distributional Reinforcement Learning
- Neural Network Ensembles: Theory, Training, and the Importance of Explicit Diversity
- Sample-based Distributional Policy Gradient
- ADER:Adapting between Exploration and Robustness for Actor-Critic Methods