Trust Region Policy Optimization
arXiv:1502.05477
Abstract
We describe an iterative procedure for optimizing policies, with guaranteed monotonic improvement. By making several approximations to the theoretically-justified procedure, we develop a practical algorithm, called Trust Region Policy Optimization (TRPO). This algorithm is similar to natural policy gradient methods and is effective for optimizing large nonlinear policies such as neural networks. Our experiments demonstrate its robust performance on a wide variety of tasks: learning simulated robotic swimming, hopping, and walking gaits; and playing Atari games using images of the screen as input. Despite its approximations that deviate from the theory, TRPO tends to give monotonic improvement, with little tuning of hyperparameters.
16 pages, ICML 2015
References in corpus (1)
Cited by in corpus (973)
- Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks
- A Brief Survey of Deep Reinforcement Learning
- Addressing Function Approximation Error in Actor-Critic Methods
- Soft Actor-Critic Algorithms and Applications
- Learning agile and dynamic motor skills for legged robots
- Deep Reinforcement Learning for Multi-Agent Systems: A Review of Challenges, Solutions and Applications
- DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills
- Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems
- A Survey and Critique of Multiagent Deep Reinforcement Learning
- Deep Reinforcement Learning for Cyber Security
- Noisy Networks for Exploration
- How to Train Your Robot with Deep Reinforcement Learning; Lessons We've Learned
- A Review of Deep Reinforcement Learning for Smart Building Energy Management
- Reinforcement Learning for Selective Key Applications in Power Systems: Recent Advances and Future Challenges
- Reinforcement Learning with Deep Energy-Based Policies
- Robust Adversarial Reinforcement Learning
- An Algorithmic Perspective on Imitation Learning
- How Generative Adversarial Networks and Their Variants Work: An Overview
- Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction
- Advances and Challenges in Conversational Recommender Systems: A Survey
- Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- Distributional Soft Actor-Critic: Off-Policy Reinforcement Learning for Addressing Value Estimation Errors
- Learning to schedule job-shop problems: Representation and policy learning using graph neural network and reinforcement learning
- #Exploration: A Study of Count-Based Exploration for Deep Reinforcement Learning
- Continuous Deep Q-Learning with Model-based Acceleration
- A review on locomotion robophysics: the study of movement at the intersection of robotics, soft matter and dynamical systems
- Actor-Attention-Critic for Multi-Agent Reinforcement Learning
- Off-Policy Deep Reinforcement Learning without Exploration
- Cooperative Multi-Agent Deep Reinforcement Learning for Reliable Surveillance via Autonomous Multi-UAV Control
- Behavior Regularized Offline Reinforcement Learning
- MOPO: Model-based Offline Policy Optimization
- Reinforcement Learning with Augmented Data
- Benchmarking Model-Based Reinforcement Learning
- A Survey of Reinforcement Learning Algorithms for Dynamically Varying Environments
- A Survey of Deep RL and IL for Autonomous Driving Policy Learning
- Comparison of Deep Reinforcement Learning and Model Predictive Control for Adaptive Cruise Control
- Deep Reinforcement Learning Attitude Control of Fixed-Wing UAVs Using Proximal Policy Optimization
- Federated Reinforcement Learning: Techniques, Applications, and Open Challenges
- Memory-based control with recurrent neural networks
- A Survey on Neural Architecture Search
- dm_control: Software and Tasks for Continuous Control
- Differentiable MPC for End-to-end Planning and Control
- Flow: A Modular Learning Framework for Mixed Autonomy Traffic
- Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain
- A Review of Tracking, Prediction and Decision Making Methods for Autonomous Driving
- Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning
- Control of Memory, Active Perception, and Action in Minecraft
- Causal Confusion in Imitation Learning
- Machine Learning for Intelligent Optical Networks: A Comprehensive Survey
- Lyapunov-based Safe Policy Optimization for Continuous Control
- Survey on reinforcement learning for language processing
- DRL-VO: Learning to Navigate Through Crowded Dynamic Scenes Using Velocity Obstacles
- Transfer Learning in Deep Reinforcement Learning: A Survey
- Autonomous Unmanned Aerial Vehicle Navigation using Reinforcement Learning: A Systematic Review
- A Survey of Deep Reinforcement Learning in Video Games
- Multi-agent Reinforcement Learning for Cooperative Lane Changing of Connected and Autonomous Vehicles in Mixed Traffic
- Third-Person Imitation Learning
- Reinforcement Learning for Angle-Only Intercept Guidance of Maneuvering Targets
- Game-Theoretic Multiagent Reinforcement Learning
- Variational Discriminator Bottleneck: Improving Imitation Learning, Inverse RL, and GANs by Constraining Information Flow
- Deep Deterministic Policy Gradient for Urban Traffic Light Control
- Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO
- Modeling Human Driving Behavior through Generative Adversarial Imitation Learning
- RLOC: Terrain-Aware Legged Locomotion using Reinforcement Learning and Optimal Control
- Dark, Beyond Deep: A Paradigm Shift to Cognitive AI with Humanlike Common Sense
- Collective Robot Reinforcement Learning with Distributed Asynchronous Guided Policy Search
- Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog
- Algorithmic Framework for Model-based Deep Reinforcement Learning with Theoretical Guarantees
- DARLA: Improving Zero-Shot Transfer in Reinforcement Learning
- Paired Open-Ended Trailblazer (POET): Endlessly Generating Increasingly Complex and Diverse Learning Environments and Their Solutions
- A Theoretical Analysis of Deep Q-Learning
- Generative Design by Reinforcement Learning: Enhancing the Diversity of Topology Optimization Designs
- A Survey of Algorithms for Black-Box Safety Validation of Cyber-Physical Systems
- When to Trust Your Model: Model-Based Policy Optimization
- On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift
- Reinforcement Learning Algorithms: An Overview and Classification
- A review on deep reinforcement learning for fluid mechanics: an update
- Reset-free Trial-and-Error Learning for Robot Damage Recovery
- A review on Deep Reinforcement Learning for Fluid Mechanics
- RUDDER: Return Decomposition for Delayed Rewards
- Model-Based Meta-Reinforcement Learning for Flight with Suspended Payloads
- Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning
- Q-Prop: Sample-Efficient Policy Gradient with An Off-Policy Critic
- A Review of Robot Learning for Manipulation: Challenges, Representations, and Algorithms
- Neural Network-based Flight Control Systems: Present and Future
- Automated Reinforcement Learning (AutoRL): A Survey and Open Problems
- Generative Adversarial Imitation from Observation
- Neural Policy Gradient Methods: Global Optimality and Rates of Convergence
- Efficient Exploration via State Marginal Matching
- Combining Model-Based and Model-Free Updates for Trajectory-Centric Reinforcement Learning
- Controlling an Autonomous Vehicle with Deep Reinforcement Learning
- Deeply AggreVaTeD: Differentiable Imitation Learning for Sequential Prediction
- Horizon: Facebook's Open Source Applied Reinforcement Learning Platform
- Trust Region Policy Optimisation in Multi-Agent Reinforcement Learning
- Learning Predictive Representations for Deformable Objects Using Contrastive Estimation
- On the Global Convergence Rates of Softmax Policy Gradient Methods
- Projection-Based Constrained Policy Optimization
- Fusion of Model-free Reinforcement Learning with Microgrid Control: Review and Vision
- Exploring Model-based Planning with Policy Networks
- Deep Reinforcement Learning for Quantum State Preparation with Weak Nonlinear Measurements
- ChainerRL: A Deep Reinforcement Learning Library
- Dynamics-Aware Unsupervised Discovery of Skills
- Robust High-speed Running for Quadruped Robots via Deep Reinforcement Learning
- Adaptive dynamic programming for nonaffine nonlinear optimal control problem with state constraints
- MO-MIX: Multi-Objective Multi-Agent Cooperative Decision-Making With Deep Reinforcement Learning
- Open-Sourced Reinforcement Learning Environments for Surgical Robotics
- Discrete Sequential Prediction of Continuous Actions for Deep RL
- Model-based Deep Reinforcement Learning for Dynamic Portfolio Optimization
- Queueing Network Controls via Deep Reinforcement Learning
- Deep Reinforcement Learning for Event-Driven Multi-Agent Decision Processes
- Deep Hierarchical Reinforcement Learning Algorithm in Partially Observable Markov Decision Processes
- Improving Generalization in Meta Reinforcement Learning using Learned Objectives
- Unified Automatic Control of Vehicular Systems with Reinforcement Learning
- Near-Optimal Representation Learning for Hierarchical Reinforcement Learning
- Six Degree-of-Freedom Body-Fixed Hovering over Unmapped Asteroids via LIDAR Altimetry and Reinforcement Meta-Learning
- Freeway Merging in Congested Traffic based on Multipolicy Decision Making with Passive Actor Critic
- FedKL: Tackling Data Heterogeneity in Federated Reinforcement Learning by Penalizing KL Divergence
- Neurosymbolic Reinforcement Learning and Planning: A Survey
- Bitcoin Transaction Strategy Construction Based on Deep Reinforcement Learning
- Accelerating Reinforcement Learning for Reaching using Continuous Curriculum Learning
- Automatic Data Augmentation for Generalization in Deep Reinforcement Learning
- First Order Constrained Optimization in Policy Space
- Residual Policy Learning
- Deep Imitation Learning for Complex Manipulation Tasks from Virtual Reality Teleoperation
- rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch
- Learning Scheduling Algorithms for Data Processing Clusters
- Reinforcement Learning for Generative AI: State of the Art, Opportunities and Open Research Challenges
- A differentiable programming method for quantum control
- ACES -- Automatic Configuration of Energy Harvesting Sensors with Reinforcement Learning
- Adversarial Examples in Modern Machine Learning: A Review
- Autonomous Platoon Control with Integrated Deep Reinforcement Learning and Dynamic Programming
- AI-GAs: AI-generating algorithms, an alternate paradigm for producing general artificial intelligence
- Deployment-Efficient Reinforcement Learning via Model-Based Offline Optimization
- A reinforcement learning approach to rare trajectory sampling
- Dealing with Sparse Rewards in Reinforcement Learning
- Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning
- Network Randomization: A Simple Technique for Generalization in Deep Reinforcement Learning
- SUNRISE: A Simple Unified Framework for Ensemble Learning in Deep Reinforcement Learning
- Prescribed Generative Adversarial Networks
- Improving Generalization in Reinforcement Learning with Mixture Regularization
- A Reinforcement Learning Environment For Job-Shop Scheduling
- Robust Reinforcement Learning on State Observations with Learned Optimal Adversary
- Deep Reinforcement Learning for Cybersecurity Threat Detection and Protection: A Review
- Reinforcement Learning Applications
- Understanding the impact of entropy on policy optimization
- Almost Optimal Model-Free Reinforcement Learning via Reference-Advantage Decomposition
- Effective Diversity in Population Based Reinforcement Learning
- Model-Based Reinforcement Learning with Adversarial Training for Online Recommendation
- Off-Policy Policy Gradient with State Distribution Correction
- Responsive Safety in Reinforcement Learning by PID Lagrangian Methods
- Multi-Pass Q-Networks for Deep Reinforcement Learning with Parameterised Action Spaces
- Model-Augmented Actor-Critic: Backpropagating through Paths
- Networked Multiagent Safe Reinforcement Learning for Low-carbon Demand Management in Distribution Network
- Learning an Adaptive Learning Rate Schedule
- V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control
- Distilling Policy Distillation
- Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization
- Constrained Attractor Selection Using Deep Reinforcement Learning
- Search on the Replay Buffer: Bridging Planning and Reinforcement Learning
- Primal Wasserstein Imitation Learning
- Robust Deep Reinforcement Learning against Adversarial Perturbations on State Observations
- Sample Efficient Policy Gradient Methods with Recursive Variance Reduction
- Global Convergence of Policy Gradient Methods to (Almost) Locally Optimal Policies
- Variational Policy Gradient Method for Reinforcement Learning with General Utilities
- Curriculum-based Reinforcement Learning for Distribution System Critical Load Restoration
- Policy Teaching via Environment Poisoning: Training-time Adversarial Attacks against Reinforcement Learning
- From Screens to Scenes: A Survey of Embodied AI in Healthcare
- Reinforcement Learning for Robotic Manipulation using Simulated Locomotion Demonstrations
- Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges
- Wasserstein Adversarial Imitation Learning
- Deconfounding Reinforcement Learning in Observational Settings
- Generalizing Skills with Semi-Supervised Reinforcement Learning
- Automatic Curriculum Learning through Value Disagreement
- Optimizing Collision Avoidance in Dense Airspace using Deep Reinforcement Learning
- Making Deep Q-learning methods robust to time discretization
- Is a Good Representation Sufficient for Sample Efficient Reinforcement Learning?
- DeepRacer: Educational Autonomous Racing Platform for Experimentation with Sim2Real Reinforcement Learning
- Q-learning with UCB Exploration is Sample Efficient for Infinite-Horizon MDP
- Conservative Safety Critics for Exploration
- Policy Gradient based Quantum Approximate Optimization Algorithm
- A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines
- Goal-conditioned Imitation Learning
- BAIL: Best-Action Imitation Learning for Batch Deep Reinforcement Learning
- Node Injection Attacks on Graphs via Reinforcement Learning
- Theoretical Convergence of Multi-Step Model-Agnostic Meta-Learning
- An Improved Analysis of (Variance-Reduced) Policy Gradient and Natural Policy Gradient Methods
- Value constrained model-free continuous control
- Q-Learning in enormous action spaces via amortized approximate maximization
- Reinforcement Meta-Learning for Interception of Maneuvering Exoatmospheric Targets with Parasitic Attitude Loop
- Model-free Deep Reinforcement Learning for Urban Autonomous Driving
- Learning to Defend by Learning to Attack
- Boundary-aware Supervoxel-level Iteratively Refined Interactive 3D Image Segmentation with Multi-agent Reinforcement Learning
- Automated Cloud Provisioning on AWS using Deep Reinforcement Learning
- Trajectory Planning with Deep Reinforcement Learning in High-Level Action Spaces
- Scalable Bilinear Learning Using State and Action Features
- Application of Soft Actor-Critic Algorithms in Optimizing Wastewater Treatment with Time Delays Integration
- PC-PG: Policy Cover Directed Exploration for Provable Policy Gradient Learning
- Model-based Adversarial Imitation Learning
- Road Traffic Law Adaptive Decision-making for Self-Driving Vehicles
- Trust-Region Method with Deep Reinforcement Learning in Analog Design Space Exploration
- Qualitative Measurements of Policy Discrepancy for Return-Based Deep Q-Network
- The Ingredients of Real-World Robotic Reinforcement Learning
- A Closer Look at Deep Policy Gradients
- Learning to Reach Goals via Iterated Supervised Learning
- Autonomous Driving in Reality with Reinforcement Learning and Image Translation
- Online Deep Reinforcement Learning for Autonomous UAV Navigation and Exploration of Outdoor Environments
- Advances in Variational Inference
- TRC: Trust Region Conditional Value at Risk for Safe Reinforcement Learning
- Neuroflight: Next Generation Flight Control Firmware
- Settling the Variance of Multi-Agent Policy Gradients
- Interpretable End-to-end Urban Autonomous Driving with Latent Deep Reinforcement Learning
- Deep Reinforcement Learning in Computer Vision: A Comprehensive Survey
- The Importance of Pessimism in Fixed-Dataset Policy Optimization
- Learning Self-Imitating Diverse Policies
- Benchmarks for Deep Off-Policy Evaluation
- Mirror Descent Policy Optimization
- Robust MAML: Prioritization task buffer with adaptive learning process for model-agnostic meta-learning
- TStarBot-X: An Open-Sourced and Comprehensive Study for Efficient League Training in StarCraft II Full Game
- Variational Dynamic for Self-Supervised Exploration in Deep Reinforcement Learning
- IPO: Interior-point Policy Optimization under Constraints
- Towards Interpretable-AI Policies Induction using Evolutionary Nonlinear Decision Trees for Discrete Action Systems
- Inverse reinforcement learning for video games
- Model-Based Planning with Discrete and Continuous Actions
- Rethinking Closed-loop Training for Autonomous Driving
- Optimal Stroke Learning with Policy Gradient Approach for Robotic Table Tennis
- Optimistic Reinforcement Learning by Forward Kullback-Leibler Divergence Optimization
- On-Policy Robot Imitation Learning from a Converging Supervisor
- Adaptive Stress Testing with Reward Augmentation for Autonomous Vehicle Validation
- Knowledge Transfer in Multi-Task Deep Reinforcement Learning for Continuous Control
- Reinforcement Learning for Molecular Design Guided by Quantum Mechanics
- Sample-Efficient Imitation Learning via Generative Adversarial Nets
- Feudal Multi-Agent Hierarchies for Cooperative Reinforcement Learning
- Efficient Model-free Reinforcement Learning in Metric Spaces
- Better Fine-Tuning by Reducing Representational Collapse
- Internet Congestion Control via Deep Reinforcement Learning
- Boosting Trust Region Policy Optimization by Normalizing Flows Policy
- A Survey of Deep Reinforcement Learning in Recommender Systems: A Systematic Review and Future Directions
- Provably Efficient Imitation Learning from Observation Alone
- Learning latent state representation for speeding up exploration
- Generalization in Transfer Learning
- Adversary A3C for Robust Reinforcement Learning
- Reinforcement Learning on Variable Impedance Controller for High-Precision Robotic Assembly
- Trust the Model When It Is Confident: Masked Model-based Actor-Critic
- Wasserstein Distance guided Adversarial Imitation Learning with Reward Shape Exploration
- Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring Statewise Safety
- Whole-Body Control of a Mobile Manipulator using End-to-End Reinforcement Learning
- Model-free Reinforcement Learning in Infinite-horizon Average-reward Markov Decision Processes
- Tsallis Reinforcement Learning: A Unified Framework for Maximum Entropy Reinforcement Learning
- A Machine Learning Approach to Routing
- Online Meta-Critic Learning for Off-Policy Actor-Critic Methods
- Design of intentional backdoors in sequential models
- Distributionally Robust Reinforcement Learning
- Optimal Attacks on Reinforcement Learning Policies
- Learning to Manipulate Deformable Objects without Demonstrations
- A Survey on Autonomous Vehicle Control in the Era of Mixed-Autonomy: From Physics-Based to AI-Guided Driving Policy Learning
- State Alignment-based Imitation Learning
- On the Convergence and Sample Efficiency of Variance-Reduced Policy Gradient Method
- Automated Lane Change Strategy using Proximal Policy Optimization-based Deep Reinforcement Learning
- Meta-SAC: Auto-tune the Entropy Temperature of Soft Actor-Critic via Metagradient
- Exploiting Hierarchy for Learning and Transfer in KL-regularized RL
- Feedback Linearization for Unknown Systems via Reinforcement Learning
- Error Bounds of Imitating Policies and Environments
- Sparse Graphical Memory for Robust Planning
- What Matters for Adversarial Imitation Learning?
- Robust and Scalable Routing with Multi-Agent Deep Reinforcement Learning for MANETs
- Training Agents using Upside-Down Reinforcement Learning
- Deep Reinforcement Learning and Transportation Research: A Comprehensive Review
- SAMBA: Safe Model-Based & Active Reinforcement Learning
- Using Reinforcement Learning with Partial Vehicle Detection for Intelligent Traffic Signal Control
- Lipschitzness Is All You Need To Tame Off-policy Generative Adversarial Imitation Learning
- On the Sample Complexity of Stability Constrained Imitation Learning
- Efficient Off-Policy Safe Reinforcement Learning Using Trust Region Conditional Value at Risk
- Learning Dynamics Model in Reinforcement Learning by Incorporating the Long Term Future
- Regularization Matters in Policy Optimization
- When Blockchain Meets AI: Optimal Mining Strategy Achieved By Machine Learning
- A hybrid learning method for system identification and optimal control
- Provably Efficient Exploration in Policy Optimization
- Deep Reinforcement Learning with Robust and Smooth Policy
- Local policy search with Bayesian optimization
- Multi-Agent Constrained Policy Optimisation
- Deep Predictive Policy Training using Reinforcement Learning
- Offline RL Without Off-Policy Evaluation
- DRLDO: A novel DRL based De-ObfuscationSystem for Defense against Metamorphic Malware
- Imitation Learning from Imperfect Demonstration
- A Unified Bellman Optimality Principle Combining Reward Maximization and Empowerment
- A Bi-Level Framework for Learning to Solve Combinatorial Optimization on Graphs
- VR-Goggles for Robots: Real-to-sim Domain Adaptation for Visual Control
- Reward-Conditioned Policies
- Hamilton-Jacobi Deep Q-Learning for Deterministic Continuous-Time Systems with Lipschitz Continuous Controls
- Modern Deep Reinforcement Learning Algorithms
- Explore, Discover and Learn: Unsupervised Discovery of State-Covering Skills
- From self-tuning regulators to reinforcement learning and back again
- Sample Efficient Path Integral Control under Uncertainty
- Deep Reinforcement Learning for Dexterous Manipulation with Concept Networks
- A Survey of Knowledge-based Sequential Decision Making under Uncertainty
- An Imitation from Observation Approach to Transfer Learning with Dynamics Mismatch
- Deep Reinforcement Learning for Event-Triggered Control
- Can Increasing Input Dimensionality Improve Deep Reinforcement Learning?
- Hierarchical Reinforcement Learning Framework for Stochastic Spaceflight Campaign Design
- Flight Controller Synthesis Via Deep Reinforcement Learning
- On the role of planning in model-based deep reinforcement learning
- Constrained Model-based Reinforcement Learning with Robust Cross-Entropy Method
- Curriculum Learning for Safe Mapless Navigation
- Neural Logic Reinforcement Learning
- A Short Survey On Memory Based Reinforcement Learning
- Toward Packet Routing with Fully-distributed Multi-agent Deep Reinforcement Learning
- Vulnerability-Aware Poisoning Mechanism for Online RL with Unknown Dynamics
- Long Short-Term Memory for Spatial Encoding in Multi-Agent Path Planning
- Remember and Forget for Experience Replay
- Behavior Priors for Efficient Reinforcement Learning
- Discretizing Continuous Action Space for On-Policy Optimization
- Adaptive Guidance with Reinforcement Meta-Learning
- Learning Visual Robotic Control Efficiently with Contrastive Pre-training and Data Augmentation
- Stochastic Recursive Momentum for Policy Gradient Methods
- Hallucinative Topological Memory for Zero-Shot Visual Planning
- Tuning-free Plug-and-Play Proximal Algorithm for Inverse Imaging Problems
- Ctrl-Z: Recovering from Instability in Reinforcement Learning
- Automatic Gesture Recognition in Robot-assisted Surgery with Reinforcement Learning and Tree Search
- Driver Assistance Eco-driving and Transmission Control with Deep Reinforcement Learning
- Asymptotic optimality of adaptive importance sampling
- Internal Model from Observations for Reward Shaping
- Mirror Descent Search and its Acceleration
- D2RL: Deep Dense Architectures in Reinforcement Learning
- Learning Belief Representations for Imitation Learning in POMDPs
- Sub-policy Adaptation for Hierarchical Reinforcement Learning
- Neural Temporal-Difference and Q-Learning Provably Converge to Global Optima
- Convergence Rates of Accelerated Markov Gradient Descent with Applications in Reinforcement Learning
- Orchestrating the Development Lifecycle of Machine Learning-Based IoT Applications: A Taxonomy and Survey
- Deep Reinforcement Learning Architecture for Continuous Power Allocation in High Throughput Satellites
- Learning Dexterous Manipulation from Suboptimal Experts
- Constrained episodic reinforcement learning in concave-convex and knapsack settings
- Striving for Simplicity and Performance in Off-Policy DRL: Output Normalization and Non-Uniform Sampling
- Asynchronous Methods for Model-Based Reinforcement Learning
- Revisiting Design Choices in Proximal Policy Optimization
- Model-Free Reinforcement Learning: from Clipped Pseudo-Regret to Sample Complexity
- Reinforcement Learning Testbed for Power-Consumption Optimization
- Applications of Multi-Agent Reinforcement Learning in Future Internet: A Comprehensive Survey
- Deep Reinforcement Learning for Autonomous Internet of Things: Model, Applications and Challenges
- PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training
- Simplifying Deep Reinforcement Learning via Self-Supervision
- Adversarially Guided Actor-Critic
- Fast Efficient Hyperparameter Tuning for Policy Gradients
- Energy-Based Imitation Learning
- Algorithms in Multi-Agent Systems: A Holistic Perspective from Reinforcement Learning and Game Theory
- Surprising Negative Results for Generative Adversarial Tree Search
- p-Meta: Towards On-device Deep Model Adaptation
- Scalable Deep Reinforcement Learning for Ride-Hailing
- F2A2: Flexible Fully-decentralized Approximate Actor-critic for Cooperative Multi-agent Reinforcement Learning
- Batch Policy Learning under Constraints
- Sketch Less for More: On-the-Fly Fine-Grained Sketch Based Image Retrieval
- Attractor Selection in Nonlinear Energy Harvesting Using Deep Reinforcement Learning
- Muesli: Combining Improvements in Policy Optimization
- Robust Reinforcement Learning via Adversarial training with Langevin Dynamics
- Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning
- Connecting the Dots Between MLE and RL for Sequence Prediction
- World Discovery Models
- SMiRL: Surprise Minimizing Reinforcement Learning in Unstable Environments
- Top-K Off-Policy Correction for a REINFORCE Recommender System
- A Tutorial on Sparse Gaussian Processes and Variational Inference
- Risk Averse Robust Adversarial Reinforcement Learning
- Microscopic Traffic Simulation by Cooperative Multi-agent Deep Reinforcement Learning
- Provably Robust Blackbox Optimization for Reinforcement Learning
- Adversarial Imitation Learning via Random Search
- Simulation to Scaled City: Zero-Shot Policy Transfer for Traffic Control via Autonomous Vehicles
- On the Utility of Model Learning in HRI
- Neural Replicator Dynamics
- Deep Learning based Wireless Resource Allocation with Application to Vehicular Networks
- -GAIL: Learning -Divergence for Generative Adversarial Imitation Learning
- Optimistic Policy Optimization with Bandit Feedback
- Rapidly Adaptable Legged Robots via Evolutionary Meta-Learning
- Personalizing Task-oriented Dialog Systems via Zero-shot Generalizable Reward Function
- How to Learn a Useful Critic? Model-based Action-Gradient-Estimator Policy Optimization
- Learning Sparse Rewarded Tasks from Sub-Optimal Demonstrations
- Self-Imitation Learning via Generalized Lower Bound Q-learning
- Lifelong Policy Gradient Learning of Factored Policies for Faster Training Without Forgetting
- Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling
- Robust Policy Gradient against Strong Data Corruption
- Divide-and-Conquer Reinforcement Learning
- Composing Task-Agnostic Policies with Deep Reinforcement Learning
- Effective Scheduling Function Design in SDN through Deep Reinforcement Learning
- Multi-Agent Trust Region Policy Optimization
- Snooping Attacks on Deep Reinforcement Learning
- Divergence-Augmented Policy Optimization
- Dynamic Experience Replay
- Imitation Learning: Progress, Taxonomies and Challenges
- A Deep Reinforcement Learning Framework for Eco-driving in Connected and Automated Hybrid Electric Vehicles
- Improving GAN Training with Probability Ratio Clipping and Sample Reweighting
- Autonomous Six-Degree-of-Freedom Spacecraft Docking Maneuvers via Reinforcement Learning
- Deep reinforcement learning driven inspection and maintenance planning under incomplete information and constraints
- A Re-classification of Information Seeking Tasks and Their Computational Solutions
- Context Meta-Reinforcement Learning via Neuromodulation
- Learning and Planning in Complex Action Spaces
- Self-supervised Learning of Distance Functions for Goal-Conditioned Reinforcement Learning
- Revisiting Parameter Sharing in Multi-Agent Deep Reinforcement Learning
- Hierarchical Policy Learning is Sensitive to Goal Space Design
- Proximal Policy Optimization with Relative Pearson Divergence
- Bridging Transient and Steady-State Performance in Voltage Control: A Reinforcement Learning Approach with Safe Gradient Flow
- Multi-Agent Deep Reinforcement Learning for Request Dispatching in Distributed-Controller Software-Defined Networking
- Modeling and Optimization Trade-off in Meta-learning
- Using RGB Image as Visual Input for Mapless Robot Navigation
- Policy Gradient in Partially Observable Environments: Approximation and Convergence
- Learning-Driven Exploration for Reinforcement Learning
- Smooth Exploration for Robotic Reinforcement Learning
- Causal-aware Safe Policy Improvement for Task-oriented dialogue
- Improving Safety in Reinforcement Learning Using Model-Based Architectures and Human Intervention
- Lyapunov Barrier Policy Optimization
- The Adaptive Stress Testing Formulation
- Offline Reinforcement Learning with Soft Behavior Regularization
- Hybrid Actor-Critic Reinforcement Learning in Parameterized Action Space
- Towards Effective Context for Meta-Reinforcement Learning: an Approach based on Contrastive Learning
- Adaptive Trade-Offs in Off-Policy Learning
- Kalman meets Bellman: Improving Policy Evaluation through Value Tracking
- Hardware as Policy: Mechanical and Computational Co-Optimization using Deep Reinforcement Learning
- Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences
- On Computation and Generalization of Generative Adversarial Imitation Learning
- Noise-Robust End-to-End Quantum Control using Deep Autoregressive Policy Networks
- Maximum Mutation Reinforcement Learning for Scalable Control
- Safe Reinforcement Learning of Control-Affine Systems with Vertex Networks
- Optimization Landscape of Gradient Descent for Discrete-time Static Output Feedback
- Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance
- Towards Similarity Graphs Constructed by Deep Reinforcement Learning
- Model-based Lookahead Reinforcement Learning
- Learning to Predict Without Looking Ahead: World Models Without Forward Prediction
- Differentiable Logic Machines
- Artificial Intelligence in Drug Discovery: Applications and Techniques
- OffWorld Gym: open-access physical robotics environment for real-world reinforcement learning benchmark and research
- Policy Teaching in Reinforcement Learning via Environment Poisoning Attacks
- Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning
- Derivative-Free Policy Optimization for Linear Risk-Sensitive and Robust Control Design: Implicit Regularization and Sample Complexity
- Scalable Voltage Control using Structure-Driven Hierarchical Deep Reinforcement Learning
- Dependency-aware Attention Control for Unconstrained Face Recognition with Image Sets
- Variational Quantum Circuit Design for Quantum Reinforcement Learning on Continuous Environments
- Imitation-Projected Programmatic Reinforcement Learning
- Safety Filtering for Reinforcement Learning-based Adaptive Cruise Control
- Provable Fictitious Play for General Mean-Field Games
- Energy-Based Sequence GANs for Recommendation and Their Connection to Imitation Learning
- Rare event failure test case generation in Learning-Enabled-Controllers
- Safety Augmented Value Estimation from Demonstrations (SAVED): Safe Deep Model-Based RL for Sparse Cost Robotic Tasks
- Learning to Track Dynamic Targets in Partially Known Environments
- Control-Aware Representations for Model-based Reinforcement Learning
- Delay-Aware Model-Based Reinforcement Learning for Continuous Control
- Efficient Model-Based Reinforcement Learning through Optimistic Policy Search and Planning
- Effective Exploration for Deep Reinforcement Learning via Bootstrapped Q-Ensembles under Tsallis Entropy Regularization
- TD or not TD: Analyzing the Role of Temporal Differencing in Deep Reinforcement Learning
- On Entropy Regularized Path Integral Control for Trajectory Optimization
- Data-efficient Hindsight Off-policy Option Learning
- Continuous-action Reinforcement Learning for Playing Racing Games: Comparing SPG to PPO
- Spatial Graph Attention and Curiosity-driven Policy for Antiviral Drug Discovery
- Ready Policy One: World Building Through Active Learning
- Decision-making for Autonomous Vehicles on Highway: Deep Reinforcement Learning with Continuous Action Horizon
- Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence
- ROS2Learn: a reinforcement learning framework for ROS 2
- Counterfactual Credit Assignment in Model-Free Reinforcement Learning
- Sub-Goal Trees -- a Framework for Goal-Based Reinforcement Learning
- Adaptive Approximate Policy Iteration
- Increasing performance of electric vehicles in ride-hailing services using deep reinforcement learning
- Safe Reinforcement Learning with Natural Language Constraints
- Stochastic Variance Reduction for Policy Gradient Estimation
- Decentralized Cooperative Lane Changing at Freeway Weaving Areas Using Multi-Agent Deep Reinforcement Learning
- Deep Reinforcement Learning for Demand Driven Services in Logistics and Transportation Systems: A Survey
- Safe Reinforcement Learning for Autonomous Vehicles through Parallel Constrained Policy Optimization
- Scalable Multi-Agent Inverse Reinforcement Learning via Actor-Attention-Critic
- Powerpropagation: A sparsity inducing weight reparameterisation
- PixelRL: Fully Convolutional Network with Reinforcement Learning for Image Processing
- Deep reinforcement learning for complex evaluation of one-loop diagrams in quantum field theory
- Softmax Policy Gradient Methods Can Take Exponential Time to Converge
- Fighting Failures with FIRE: Failure Identification to Reduce Expert Burden in Intervention-Based Learning
- Cautiously Optimistic Policy Optimization and Exploration with Linear Function Approximation
- Stable Policy Optimization via Off-Policy Divergence Regularization
- EMaQ: Expected-Max Q-Learning Operator for Simple Yet Effective Offline and Online RL
- A Framework for Studying Reinforcement Learning and Sim-to-Real in Robot Soccer
- Learning Actionable Representations with Goal-Conditioned Policies
- On Connections between Constrained Optimization and Reinforcement Learning
- An Efficient and Uncertainty-aware Reinforcement Learning Framework for Quality Assurance in Extrusion Additive Manufacturing
- Tonic: A Deep Reinforcement Learning Library for Fast Prototyping and Benchmarking
- Adversarial Soft Advantage Fitting: Imitation Learning without Policy Optimization
- A Hybrid Stochastic Policy Gradient Algorithm for Reinforcement Learning
- Accelerating Training in Pommerman with Imitation and Reinforcement Learning
- Bayesian Curiosity for Efficient Exploration in Reinforcement Learning
- Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics
- Guidance Design for Escape Flight Vehicle Using Evolution Strategy Enhanced Deep Reinforcement Learning
- Policy-Aware Model Learning for Policy Gradient Methods
- Local Search for Policy Iteration in Continuous Control
- Population-Guided Parallel Policy Search for Reinforcement Learning
- Colored Noise in PPO: Improved Exploration and Performance through Correlated Action Sampling
- MARS: Malleable Actor-Critic Reinforcement Learning Scheduler
- Decision Making for Autonomous Driving via Augmented Adversarial Inverse Reinforcement Learning
- Calibration of Shared Equilibria in General Sum Partially Observable Markov Games
- Adversarial Imitation via Variational Inverse Reinforcement Learning
- Partially Detected Intelligent Traffic Signal Control: Environmental Adaptation
- Differentiable Trust Region Layers for Deep Reinforcement Learning
- Reinforcement Learning vs. Gradient-Based Optimisation for Robust Energy Landscape Control of Spin-1/2 Quantum Networks
- Implicit Policy for Reinforcement Learning
- An End-to-end Deep Reinforcement Learning Approach for the Long-term Short-term Planning on the Frenet Space
- Marginal Policy Gradients: A Unified Family of Estimators for Bounded Action Spaces with Applications
- Distributional Reinforcement Learning for Energy-Based Sequential Models
- Learning Barrier Certificates: Towards Safe Reinforcement Learning with Zero Training-time Violations
- Policy Optimization for Markovian Jump Linear Quadratic Control: Gradient-Based Methods and Global Convergence
- Continuous Doubly Constrained Batch Reinforcement Learning
- Revisit Policy Optimization in Matrix Form
- Reinforcement Learning Based Safe Decision Making for Highway Autonomous Driving
- Learning Cooperative Multi-Agent Policies with Partial Reward Decoupling
- Exploration-efficient Deep Reinforcement Learning with Demonstration Guidance for Robot Control
- Information Theoretic Model Predictive Q-Learning
- From Complexity to Simplicity: Adaptive ES-Active Subspaces for Blackbox Optimization
- Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach
- TAAC: Temporally Abstract Actor-Critic for Continuous Control
- Twice regularized MDPs and the equivalence between robustness and regularization
- Control Frequency Adaptation via Action Persistence in Batch Reinforcement Learning
- Ablation Study of How Run Time Assurance Impacts the Training and Performance of Reinforcement Learning Agents
- Regularizing Trajectory Optimization with Denoising Autoencoders
- RLSS: A Deep Reinforcement Learning Algorithm for Sequential Scene Generation
- Hierarchical Decomposition of Nonlinear Dynamics and Control for System Identification and Policy Distillation
- Robust Asymmetric Learning in POMDPs
- Effects of Loss Functions And Target Representations on Adversarial Robustness
- Reinforcement Learning with Function Approximation: From Linear to Nonlinear
- Reinforcement Learning with Adaptive Curriculum Dynamics Randomization for Fault-Tolerant Robot Control
- A Visual Communication Map for Multi-Agent Deep Reinforcement Learning
- Data-efficient visuomotor policy training using reinforcement learning and generative models
- Empirical Likelihood for Contextual Bandits
- AliExpress Learning-To-Rank: Maximizing Online Model Performance without Going Online
- Imitation-Regularized Offline Learning
- GRAC: Self-Guided and Self-Regularized Actor-Critic
- Trust Region Value Optimization using Kalman Filtering
- Off-Policy Actor-Critic in an Ensemble: Achieving Maximum General Entropy and Effective Environment Exploration in Deep Reinforcement Learning
- Provable Model-based Nonlinear Bandit and Reinforcement Learning: Shelve Optimism, Embrace Virtual Curvature
- Zeroth-order Deterministic Policy Gradient
- Model Imitation for Model-Based Reinforcement Learning
- Generalized Off-Policy Actor-Critic
- Policy Learning of MDPs with Mixed Continuous/Discrete Variables: A Case Study on Model-Free Control of Markovian Jump Systems
- Triple-GAIL: A Multi-Modal Imitation Learning Framework with Generative Adversarial Nets
- Advances in Preference-based Reinforcement Learning: A Review
- First-Order Problem Solving through Neural MCTS based Reinforcement Learning
- Sample-efficient Adversarial Imitation Learning from Observation
- Lessons from Contextual Bandit Learning in a Customer Support Bot
- Offline Reinforcement Learning with Pseudometric Learning
- An operator view of policy gradient methods
- Meta Automatic Curriculum Learning
- Analyzing the Variance of Policy Gradient Estimators for the Linear-Quadratic Regulator
- Deluca -- A Differentiable Control Library: Environments, Methods, and Benchmarking
- Steady State Analysis of Episodic Reinforcement Learning
- Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation
- Understanding Adversarial Attacks on Observations in Deep Reinforcement Learning
- Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds Globally Optimal Policy
- A Model-based Approach for Sample-efficient Multi-task Reinforcement Learning
- A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms
- Imitation Learning for Human Pose Prediction
- Cooperative Highway Work Zone Merge Control based on Reinforcement Learning in A Connected and Automated Environment
- Variational Autoencoders for Opponent Modeling in Multi-Agent Systems
- Synthetic Sample Selection via Reinforcement Learning
- How Much Do Unstated Problem Constraints Limit Deep Robotic Reinforcement Learning?
- A Survey of Exploration Methods in Reinforcement Learning
- A Max-Min Entropy Framework for Reinforcement Learning
- Intrinsic Motivation for Encouraging Synergistic Behavior
- Mean-Variance Policy Iteration for Risk-Averse Reinforcement Learning
- Cache-Enabled Dynamic Rate Allocation via Deep Self-Transfer Reinforcement Learning
- An Asymptotically Optimal Multi-Armed Bandit Algorithm and Hyperparameter Optimization
- Is the Policy Gradient a Gradient?
- Learning Feasibility to Imitate Demonstrators with Different Dynamics
- Iterative Amortized Policy Optimization
- Intrinsic Motivation Driven Intuitive Physics Learning using Deep Reinforcement Learning with Intrinsic Reward Normalization
- P3O: Policy-on Policy-off Policy Optimization
- Adaptive Stress Testing for Autonomous Vehicles
- On-Policy Trust Region Policy Optimisation with Replay Buffers
- Theory-based Causal Transfer: Integrating Instance-level Induction and Abstract-level Structure Learning
- Quinoa: a Q-function You Infer Normalized Over Actions
- Learning Generalizable Locomotion Skills with Hierarchical Reinforcement Learning
- On the Sample Complexity of Reinforcement Learning with Policy Space Generalization
- Single-partition adaptive Q-learning
- Obstacle Avoidance and Navigation Utilizing Reinforcement Learning with Reward Shaping
- Optimize Neural Fictitious Self-Play in Regret Minimization Thinking
- Domain-Robust Visual Imitation Learning with Mutual Information Constraints
- Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments
- Robust Maximum Entropy Behavior Cloning
- f-IRL: Inverse Reinforcement Learning via State Marginal Matching
- A Game-Theoretic Approach to Multi-Agent Trust Region Optimization
- GenSafe: A Generalizable Safety Enhancer for Safe Reinforcement Learning Algorithms Based on Reduced Order Markov Decision Process Model
- A Risk-Sensitive Approach to Policy Optimization
- A Pragmatic Look at Deep Imitation Learning
- Continuous-Time Model-Based Reinforcement Learning
- Decoupling Value and Policy for Generalization in Reinforcement Learning
- Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
- TFPnP: Tuning-free Plug-and-Play Proximal Algorithm with Applications to Inverse Imaging Problems
- Data-driven Outer-Loop Control Using Deep Reinforcement Learning for Trajectory Tracking
- Accelerating Safe Reinforcement Learning with Constraint-mismatched Policies
- EdgeSlice: Slicing Wireless Edge Computing Network with Decentralized Deep Reinforcement Learning
- Taylor Expansion Policy Optimization
- VILD: Variational Imitation Learning with Diverse-quality Demonstrations
- Reinforcement Learning for Joint Optimization of Multiple Rewards
- Imitation Learning from Pixel-Level Demonstrations by HashReward
- Off-Policy Actor-Critic with Shared Experience Replay
- Trust-Region Variational Inference with Gaussian Mixture Models
- DOB-Net: Actively Rejecting Unknown Excessive Time-Varying Disturbances
- Learning to Score Behaviors for Guided Policy Optimization
- Learning the Graphical Structure of Electronic Health Records with Graph Convolutional Transformer
- LPaintB: Learning to Paint from Self-Supervision
- A Stochastic Derivative Free Optimization Method with Momentum
- Trajectory Optimization for Unknown Constrained Systems using Reinforcement Learning
- Crowdsensing Game with Demand Uncertainties: A Deep Reinforcement Learning Approach
- Deep Reinforcement Learning via L-BFGS Optimization
- Watch the Unobserved: A Simple Approach to Parallelizing Monte Carlo Tree Search
- IntelligentCrowd: Mobile Crowdsensing via Multi-Agent Reinforcement Learning
- On Reinforcement Learning for Turn-based Zero-sum Markov Games
- Learning to Gather without Communication
- DRAS-CQSim: A Reinforcement Learning based Framework for HPC Cluster Scheduling
- Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
- CIM-PPO:Proximal Policy Optimization with Liu-Correntropy Induced Metric
- Guided Imitation of Task and Motion Planning
- Safe Policy Improvement in Constrained Markov Decision Processes
- Discovering Fatigued Movements for Virtual Character Animation
- Recruitment-imitation Mechanism for Evolutionary Reinforcement Learning
- Task-oriented Design through Deep Reinforcement Learning
- PAC-Bayes Bounds for Bandit Problems: A Survey and Experimental Comparison
- Mean-Semivariance Policy Optimization via Risk-Averse Reinforcement Learning
- MAMRL: Exploiting Multi-agent Meta Reinforcement Learning in WAN Traffic Engineering
- Augmented Random Search for Quadcopter Control: An alternative to Reinforcement Learning
- Auto-Agent-Distiller: Towards Efficient Deep Reinforcement Learning Agents via Neural Architecture Search
- Backprop-Q: Generalized Backpropagation for Stochastic Computation Graphs
- Multi-Path Policy Optimization
- Relationship Explainable Multi-objective Optimization Via Vector Value Function Based Reinforcement Learning
- Tensor-based Cooperative Control for Large Scale Multi-intersection Traffic Signal Using Deep Reinforcement Learning and Imitation Learning
- Environment Reconstruction with Hidden Confounders for Reinforcement Learning based Recommendation
- Relationship Explainable Multi-objective Reinforcement Learning with Semantic Explainability Generation
- Co-training for Policy Learning
- Exploring Restart Distributions
- Reward-estimation variance elimination in sequential decision processes
- Communication-Efficient Policy Gradient Methods for Distributed Reinforcement Learning
- Continuous Control for Searching and Planning with a Learned Model
- Transferable Active Grasping and Real Embodied Dataset
- Policy Search by Target Distribution Learning for Continuous Control
- Imitation Learning with Sinkhorn Distances
- Transferable Cost-Aware Security Policy Implementation for Malware Detection Using Deep Reinforcement Learning
- Privacy-Preserving Kickstarting Deep Reinforcement Learning with Privacy-Aware Learners
- Exploration via Hindsight Goal Generation
- Fully Decentralized Reinforcement Learning-based Control of Photovoltaics in Distribution Grids for Joint Provision of Real and Reactive Power
- GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning
- Variance Reduction for Evolution Strategies via Structured Control Variates
- Robot Action Selection Learning via Layered Dimension Informed Program Synthesis
- Combining Pessimism with Optimism for Robust and Efficient Model-Based Deep Reinforcement Learning
- Policy Smoothing for Provably Robust Reinforcement Learning
- Robust Inverse Reinforcement Learning under Transition Dynamics Mismatch
- Bridging the Imitation Gap by Adaptive Insubordination
- Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction
- Scenic4RL: Programmatic Modeling and Generation of Reinforcement Learning Environments
- Reinforcement Learning for Flexibility Design Problems
- Health-Informed Policy Gradients for Multi-Agent Reinforcement Learning
- Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods
- Proximal Policy Optimization Smoothed Algorithm
- Continual Learning: Tackling Catastrophic Forgetting in Deep Neural Networks with Replay Processes
- Reinforcement Learning Control of Constrained Dynamic Systems with Uniformly Ultimate Boundedness Stability Guarantee
- Offline Decentralized Multi-Agent Reinforcement Learning
- HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation
- A Survey on Reproducibility by Evaluating Deep Reinforcement Learning Algorithms on Real-World Robots
- Mutual-Information Regularization in Markov Decision Processes and Actor-Critic Learning
- Continuous Transition: Improving Sample Efficiency for Continuous Control Problems via MixUp
- REPAINT: Knowledge Transfer in Deep Reinforcement Learning
- Hierarchical Expert Networks for Meta-Learning
- Competitive Experience Replay
- Conservative Data Sharing for Multi-Task Offline Reinforcement Learning
- Adversarial Imitation Learning via Random Search in Lane Change Decision-Making
- Hierarchies of Planning and Reinforcement Learning for Robot Navigation
- Tuning Mixed Input Hyperparameters on the Fly for Efficient Population Based AutoRL
- Efficient Exploration in Constrained Environments with Goal-Oriented Reference Path
- Escaping from Zero Gradient: Revisiting Action-Constrained Reinforcement Learning via Frank-Wolfe Policy Optimization
- Learning Value Functions in Deep Policy Gradients using Residual Variance
- Review, Analysis and Design of a Comprehensive Deep Reinforcement Learning Framework
- Variational Empowerment as Representation Learning for Goal-Based Reinforcement Learning
- On the Privacy Risks of Deploying Recurrent Neural Networks in Machine Learning Models
- On the Search for Feedback in Reinforcement Learning
- Hierarchically Decoupled Imitation for Morphological Transfer
- A Model-free Learning Algorithm for Infinite-horizon Average-reward MDPs with Near-optimal Regret
- Learning Diverse Policies with Soft Self-Generated Guidance
- Policy Information Capacity: Information-Theoretic Measure for Task Complexity in Deep Reinforcement Learning
- Snowflake: Scaling GNNs to High-Dimensional Continuous Control via Parameter Freezing
- Regularized Inverse Reinforcement Learning
- Follow the Object: Curriculum Learning for Manipulation Tasks with Imagined Goals
- A Distance-based Anomaly Detection Framework for Deep Reinforcement Learning
- Zeroth-Order Supervised Policy Improvement
- Equivalence Analysis between Counterfactual Regret Minimization and Online Mirror Descent
- Continuous Control with Action Quantization from Demonstrations
- Divergence-Regularized Multi-Agent Actor-Critic
- Approximate Newton policy gradient algorithms
- Uniform Priors for Data-Efficient Transfer
- Novel Policy Seeking with Constrained Optimization
- Relative Sparsity for Medical Decision Problems
- PAC-Bayesian Soft Actor-Critic Learning
- On Proximal Policy Optimization's Heavy-tailed Gradients
- Amoeba: Circumventing ML-supported Network Censorship via Adversarial Reinforcement Learning
- Improving Long-Term Metrics in Recommendation Systems using Short-Horizon Reinforcement Learning
- Average-Reward Reinforcement Learning with Trust Region Methods
- Incremental Meta-Learning via Indirect Discriminant Alignment
- Mid-flight Propeller Failure Detection and Control of Propeller-deficient Quadcopter using Reinforcement Learning
- Safe Exploration by Solving Early Terminated MDP
- Scalable Multi-agent Reinforcement Learning Algorithm for Wireless Networks
- MimicBot: Combining Imitation and Reinforcement Learning to win in Bot Bowl
- Improved Soft Actor-Critic: Mixing Prioritized Off-Policy Samples with On-Policy Experience
- Learning a Decision Module by Imitating Driver's Control Behaviors
- Policy Optimization Reinforcement Learning with Entropy Regularization
- Longitudinal Deep Truck: Deep learning and deep reinforcement learning for modeling and control of longitudinal dynamics of heavy duty trucks
- Lyapunov-stable neural-network control
- Explaining Off-Policy Actor-Critic From A Bias-Variance Perspective
- Feedback Linearization of Car Dynamics for Racing via Reinforcement Learning
- Decentralized Multi-Agent Reinforcement Learning: An Off-Policy Method
- Smooth Imitation Learning via Smooth Costs and Smooth Policies
- Finding the Near Optimal Policy via Adaptive Reduced Regularization in MDPs
- A Human-Centered Data-Driven Planner-Actor-Critic Architecture via Logic Programming
- Reinforcement Learning for Autonomous Driving with Latent State Inference and Spatial-Temporal Relationships
- Generative Inverse Deep Reinforcement Learning for Online Recommendation
- Learning Trajectories for Visual-Inertial System Calibration via Model-based Heuristic Deep Reinforcement Learning
- Randomized Adversarial Imitation Learning for Autonomous Driving
- Stochastic Lipschitz Q-Learning
- Learning Control Barrier Functions with High Relative Degree for Safety-Critical Control
- Distributed Deep Reinforcement Learning: An Overview
- Fast Adaptation with Meta-Reinforcement Learning for Trust Modelling in Human-Robot Interaction
- On the Regret Analysis of Online LQR Control with Predictions
- Optimization Issues in KL-Constrained Approximate Policy Iteration
- A Convergence Result for Regularized Actor-Critic Methods
- Improved Regret Bound and Experience Replay in Regularized Policy Iteration
- Probabilistic model predictive safety certification for learning-based control
- Learning from Imperfect Demonstrations from Agents with Varying Dynamics
- Direct Policy Gradients: Direct Optimization of Policies in Discrete Action Spaces
- Improving Context-Based Meta-Reinforcement Learning with Self-Supervised Trajectory Contrastive Learning
- Provably Correct Optimization and Exploration with Non-linear Policies
- Adversarial Imitation Learning with Trajectorial Augmentation and Correction
- Gap-Increasing Policy Evaluation for Efficient and Noise-Tolerant Reinforcement Learning
- A coevolutionary approach to deep multi-agent reinforcement learning
- Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction
- Quick Learner Automated Vehicle Adapting its Roadmanship to Varying Traffic Cultures with Meta Reinforcement Learning
- From semantics to execution: Integrating action planning with reinforcement learning for robotic causal problem-solving
- Adaptive Smoothing Path Integral Control
- Data Driven Aircraft Trajectory Prediction with Deep Imitation Learning
- Generator and Critic: A Deep Reinforcement Learning Approach for Slate Re-ranking in E-commerce
- Collision Avoidance Robotics Via Meta-Learning (CARML)
- Multi-Agent Reinforcement Learning in Cournot Games
- Competitiveness of MAP-Elites against Proximal Policy Optimization on locomotion tasks in deterministic simulations
- Reinforcement Learning for Multi-Objective Optimization of Online Decisions in High-Dimensional Systems
- Learning Adaptive Display Exposure for Real-Time Advertising
- Neural Program Synthesis By Self-Learning
- A unified view of likelihood ratio and reparameterization gradients and an optimal importance sampling scheme
- Model-Agnostic Meta-Learning using Runge-Kutta Methods
- Compatible features for Monotonic Policy Improvement
- Configurable Markov Decision Processes
- Deep Model-Based Reinforcement Learning via Estimated Uncertainty and Conservative Policy Optimization
- Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning
- Intelligent Trainer for Model-Based Reinforcement Learning
- A Tensor Network Approach to Finite Markov Decision Processes
- Disentangling Controllable Object through Video Prediction Improves Visual Reinforcement Learning
- Accelerating Reinforcement Learning with a Directional-Gaussian-Smoothing Evolution Strategy
- Safe Policy Search with Gaussian Process Models
- Asynchronous Episodic Deep Deterministic Policy Gradient: Towards Continuous Control in Computationally Complex Environments
- Model-Agnostic Learning to Meta-Learn
- Revocable Deep Reinforcement Learning with Affinity Regularization for Outlier-Robust Graph Matching
- Online Safety Assurance for Deep Reinforcement Learning
- Towards Accurate and Compact Architectures via Neural Architecture Transformer
- Improved Robustness and Safety for Autonomous Vehicle Control with Adversarial Reinforcement Learning
- Extracting Latent State Representations with Linear Dynamics from Rich Observations
- Partially Connected Automated Vehicle Cooperative Control Strategy with a Deep Reinforcement Learning Approach
- Machine Learning and System Identification for Estimation in Physical Systems
- Policy Gradient Methods Find the Nash Equilibrium in N-player General-sum Linear-quadratic Games
- Safe Distributional Reinforcement Learning
- Runtime-Safety-Guided Policy Repair
- Objective-aware Traffic Simulation via Inverse Reinforcement Learning
- Visual Explanation using Attention Mechanism in Actor-Critic-based Deep Reinforcement Learning
- Adaptive Agent Architecture for Real-time Human-Agent Teaming
- NeoNav: Improving the Generalization of Visual Navigation via Generating Next Expected Observations
- Support-weighted Adversarial Imitation Learning
- Adaptive Symmetric Reward Noising for Reinforcement Learning
- Comparing Task Simplifications to Learn Closed-Loop Object Picking Using Deep Reinforcement Learning
- Lyapunov-Based Reinforcement Learning for Decentralized Multi-Agent Control
- Neural Mask Generator: Learning to Generate Adaptive Word Maskings for Language Model Adaptation
- On Lottery Tickets and Minimal Task Representations in Deep Reinforcement Learning
- Logistic Q-Learning
- On the Expressivity of Neural Networks for Deep Reinforcement Learning
- Near Optimal Policy Optimization via REPS
- Bregman Gradient Policy Optimization
- Reinforcement Learning Experience Reuse with Policy Residual Representation
- Multi-agent Policy Optimization with Approximatively Synchronous Advantage Estimation
- General Characterization of Agents by States they Visit
- Meta Arcade: A Configurable Environment Suite for Meta-Learning
- Clustered Reinforcement Learning
- Hierarchical RNNs-Based Transformers MADDPG for Mixed Cooperative-Competitive Environments
- DM: Decentralized Multi-Agent Reinforcement Learning for Distribution Matching
- Discrete Action On-Policy Learning with Action-Value Critic
- CLARA: A Constrained Reinforcement Learning Based Resource Allocation Framework for Network Slicing
- Reinforcement Learning for High-dimensional Continuous Control in Biomechanics: An Intro to ArtiSynth-RL
- Interactive Search Based on Deep Reinforcement Learning
- Discovering an Aid Policy to Minimize Student Evasion Using Offline Reinforcement Learning
- Self-Paced Deep Reinforcement Learning
- Importance of using appropriate baselines for evaluation of data-efficiency in deep reinforcement learning for Atari
- Dr Jekyll and Mr Hyde: the Strange Case of Off-Policy Policy Updates
- Distill Knowledge in Multi-task Reinforcement Learning with Optimal-Transport Regularization
- Mean-Variance Efficient Reinforcement Learning with Applications to Dynamic Financial Investment
- Bellman: A Toolbox for Model-Based Reinforcement Learning in TensorFlow
- Soft Actor-Critic With Integer Actions
- Coordinated Proximal Policy Optimization
- Safe Reinforcement Learning for Grid Voltage Control
- Reward function shape exploration in adversarial imitation learning: an empirical study
- Automatically Learning Fallback Strategies with Model-Free Reinforcement Learning in Safety-Critical Driving Scenarios
- Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift
- Fighting Copycat Agents in Behavioral Cloning from Observation Histories
- Convex Regularization in Monte-Carlo Tree Search
- Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy
- A Generalised Inverse Reinforcement Learning Framework
- Generative Adversarial Imitation Learning for Empathy-based AI
- Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial
- Generative Question Refinement with Deep Reinforcement Learning in Retrieval-based QA System
- Reward is enough for convex MDPs
- Unifying Gradient Estimators for Meta-Reinforcement Learning via Off-Policy Evaluation
- Reinforcement Learning based Disease Progression Model for Alzheimer's Disease
- Technical Report: Adaptive Control for Linearizable Systems Using On-Policy Reinforcement Learning
- Deep Reinforcement Learning for Personalized Search Story Recommendation
- Constrained Policy Improvement for Safe and Efficient Reinforcement Learning
- DESTA: A Framework for Safe Reinforcement Learning with Markov Games of Intervention
- Analyzing Reinforcement Learning Benchmarks with Random Weight Guessing
- Fault-Tolerant Federated Reinforcement Learning with Theoretical Guarantee
- Recomposing the Reinforcement Learning Building Blocks with Hypernetworks
- Agnostic Reinforcement Learning with Low-Rank MDPs and Rich Observations
- TTR-Based Reward for Reinforcement Learning with Implicit Model Priors
- Optimistic Proximal Policy Optimization
- Bayesian Counterfactual Risk Minimization
- Measuring Progress in Deep Reinforcement Learning Sample Efficiency
- IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target Networks
- Plan-Space State Embeddings for Improved Reinforcement Learning
- A Learning-Based Computational Impact Time Guidance
- Intelligent Link Adaptation for Grant-Free Access Cellular Networks: A Distributed Deep Reinforcement Learning Approach
- Improving the sample-efficiency of neural architecture search with reinforcement learning
- Stabilizing Neural Control Using Self-Learned Almost Lyapunov Critics
- On the Sample Complexity and Metastability of Heavy-tailed Policy Search in Continuous Control
- Recurrent Control Nets for Deep Reinforcement Learning
- Learning Variable Impedance Control via Inverse Reinforcement Learning for Force-Related Tasks
- Learning Accurate Extended-Horizon Predictions of High Dimensional Trajectories
- SURREAL-System: Fully-Integrated Stack for Distributed Deep Reinforcement Learning
- Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning
- Neural-to-Tree Policy Distillation with Policy Improvement Criterion
- An Active Learning Framework for Efficient Robust Policy Search
- Planning under Uncertainty to Goal Distributions
- Data-Efficient Learning for Complex and Real-Time Physical Problem Solving using Augmented Simulation
- Quasi-Newton Trust Region Policy Optimization
- Advanced Policies: A First-Principles Path from Policy Gradient to Q-Learning
- Towards Combining On-Off-Policy Methods for Real-World Applications
- A survey of benchmarking frameworks for reinforcement learning
- ISL: A novel approach for deep exploration
- Prioritized Guidance for Efficient Multi-Agent Reinforcement Learning Exploration
- Improving the Exploration of Deep Reinforcement Learning in Continuous Domains using Planning for Policy Search
- A General Framework on Enhancing Portfolio Management with Reinforcement Learning
- Learning Transferable Concepts in Deep Reinforcement Learning
- Multi-Preference Actor Critic
- Versatile Inverse Reinforcement Learning via Cumulative Rewards
- Scenario Generalization of Data-driven Imitation Models in Crowd Simulation
- CubeTR: Learning to Solve The Rubiks Cube Using Transformers
- Model-Free Synthesis via Adversarial Reinforcement Learning
- Learning Control Policies for Imitating Human Gaits
- False Correlation Reduction for Offline Reinforcement Learning
- Distributionally Constrained Black-Box Stochastic Gradient Estimation and Optimization
- Using Reinforcement Learning to Allocate and Manage Service Function Chains in Cellular Networks
- Boosting Image Recognition with Non-differentiable Constraints
- Investigation on the generalization of the Sampled Policy Gradient algorithm
- When Autonomous Systems Meet Accuracy and Transferability through AI: A Survey
- Robot in a China Shop: Using Reinforcement Learning for Location-Specific Navigation Behaviour
- Batch size-invariance for policy optimization
- Differentiable Robust LQR Layers
- Mix and Mask Actor-Critic Methods
- On- and Off-Policy Monotonic Policy Improvement
- Curious Explorer: a provable exploration strategy in Policy Learning
- Training Transition Policies via Distribution Matching for Complex Tasks
- Cautious Actor-Critic
- Geometric Value Iteration: Dynamic Error-Aware KL Regularization for Reinforcement Learning
- Sim-to-Real Transfer of Robot Learning with Variable Length Inputs
- Refined Policy Improvement Bounds for MDPs
- Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information
- Lyapunov-based uncertainty-aware safe reinforcement learning
- Influence-Based Reinforcement Learning for Intrinsically-Motivated Agents
- Coordinate-wise Control Variates for Deep Policy Gradients
- Active Reinforcement Learning over MDPs
- On-Policy Model Errors in Reinforcement Learning
- Eden: A Unified Environment Framework for Booming Reinforcement Learning Algorithms
- Parallel Actors and Learners: A Framework for Generating Scalable RL Implementations
- Augment-Reinforce-Merge Policy Gradient for Binary Stochastic Policy
- Reinforcement learning with distance-based incentive/penalty (DIP) updates for highly constrained industrial control systems
- Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods
- Exploring More When It Needs in Deep Reinforcement Learning
- A2: Extracting Cyclic Switchings from DOB-nets for Rejecting Excessive Disturbances
- Dynamic Matching Markets in Power Grid: Concepts and Solution using Deep Reinforcement Learning
- A selected review on reinforcement learning based control for autonomous underwater vehicles
- Theoretically Principled Deep RL Acceleration via Nearest Neighbor Function Approximation
- Parameterized MDPs and Reinforcement Learning Problems -- A Maximum Entropy Principle Based Framework
- Provable Hierarchy-Based Meta-Reinforcement Learning
- Model Predictive Actor-Critic: Accelerating Robot Skill Acquisition with Deep Reinforcement Learning
- Policy Search using Dynamic Mirror Descent MPC for Model Free Off Policy RL
- Multitask Adaptation by Retrospective Exploration with Learned World Models
- EnTRPO: Trust Region Policy Optimization Method with Entropy Regularization
- Understanding the Effect of Stochasticity in Policy Optimization
- Context-aware Active Multi-Step Reinforcement Learning
- Low-Variance Policy Gradient Estimation with World Models
- Optimising Stochastic Routing for Taxi Fleets with Model Enhanced Reinforcement Learning
- Biased Estimates of Advantages over Path Ensembles
- Solving the Real Robot Challenge using Deep Reinforcement Learning
- Model-free Policy Learning with Reward Gradients
- Bootstrapped Meta-Learning
- Doubly Robust Off-Policy Actor-Critic Algorithms for Reinforcement Learning
- Bayes-Adaptive Deep Model-Based Policy Optimisation
- Implicit Regularization of Bregman Proximal Point Algorithm and Mirror Descent on Separable Data
- ES-ENAS: Efficient Evolutionary Optimization for Large Hybrid Search Spaces
- Weighted Entropy Modification for Soft Actor-Critic
- MIME: Mutual Information Minimisation Exploration
- Deterministic Value-Policy Gradients
- Emergence of Different Modes of Tool Use in a Reaching and Dragging Task
- How to Train your Quadrotor: A Framework for Consistently Smooth and Responsive Flight Control via Reinforcement Learning
- Cautious Policy Programming: Exploiting KL Regularization in Monotonic Policy Improvement for Reinforcement Learning
- Learning to Grasp from 2.5D images: a Deep Reinforcement Learning Approach
- Continuous Deep Q-Learning with Simulator for Stabilization of Uncertain Discrete-Time Systems
- CoachNet: An Adversarial Sampling Approach for Reinforcement Learning
- Adaptive Remote Sensing Image Attribute Learning for Active Object Detection
- Integration of Imitation Learning using GAIL and Reinforcement Learning using Task-achievement Rewards via Probabilistic Graphical Model
- Sufficiently Accurate Model Learning for Planning
- Distributionally-Constrained Policy Optimization via Unbalanced Optimal Transport
- L2E: Learning to Exploit Your Opponent
- Learning Efficient and Effective Exploration Policies with Counterfactual Meta Policy
- FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control
- On the Guaranteed Almost Equivalence between Imitation Learning from Observation and Demonstration
- Learning Memory-Dependent Continuous Control from Demonstrations
- Communication Efficient Parallel Reinforcement Learning
- Adaptive Experience Selection for Policy Gradient
- RNN Training along Locally Optimal Trajectories via Frank-Wolfe Algorithm
- Modelling Human Kinetics and Kinematics during Walking using Reinforcement Learning
- Learning to Reach, Swim, Walk and Fly in One Trial: Data-Driven Control with Scarce Data and Side Information
- The Gradient Convergence Bound of Federated Multi-Agent Reinforcement Learning with Efficient Communication
- No Need for Interactions: Robust Model-Based Imitation Learning using Neural ODE
- Adaptive Policy Transfer in Reinforcement Learning
- Proactive and AoI-aware Failure Recovery for Stateful NFV-enabled Zero-Touch 6G Networks: Model-Free DRL Approach
- Multitasking Inhibits Semantic Drift
- A Logarithmic Barrier Method For Proximal Policy Optimization
- Optimal Network Control in Partially-Controllable Networks
- Reinforcement Learning using Guided Observability
- Scalable, Decentralized Multi-Agent Reinforcement Learning Methods Inspired by Stigmergy and Ant Colonies
- Efficient Hyperparameter Optimization for Physics-based Character Animation
- Intrinsic Exploration as Multi-Objective RL
- Generative Exploration and Exploitation
- Sequential Anomaly Detection using Inverse Reinforcement Learning
- GymFG: A Framework with a Gym Interface for FlightGear
- RAIL: A modular framework for Reinforcement-learning-based Adversarial Imitation Learning
- Non-Asymptotic Analysis of Monte Carlo Tree Search
- Unbiased Deep Reinforcement Learning: A General Training Framework for Existing and Future Algorithms
- Diverse Exploration via Conjugate Policies for Policy Gradient Methods
- Towards Learning to Imitate from a Single Video Demonstration
- Riemannian Proximal Policy Optimization
- Co-Adaptation of Algorithmic and Implementational Innovations in Inference-based Deep Reinforcement Learning
- Explicit Gradient Learning
- Model Embedding Model-Based Reinforcement Learning
- Easy Monotonic Policy Iteration
- Off-Policy Self-Critical Training for Transformer in Visual Paragraph Generation
- Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization
- Learn a Prior for RHEA for Better Online Planning
- Lagrangian Duality in Reinforcement Learning
- Deep Reinforcement Learning for Tactile Robotics: Learning to Type on a Braille Keyboard
- Generative Actor-Critic: An Off-policy Algorithm Using the Push-forward Model
- Towards Designing a Self-Managed Machine Learning Inference Serving System inPublic Cloud
- Inverse Policy Evaluation for Value-based Sequential Decision-making
- A Probabilistic Interpretation of Self-Paced Learning with Applications to Reinforcement Learning
- Dynamic Regret Convergence Analysis and an Adaptive Regularization Algorithm for On-Policy Robot Imitation Learning
- Reinforcement Learning for Robust Missile Autopilot Design
- Efficient Reinforcement Learning Development with RLzoo
- Interaction-Aware Multi-Agent Reinforcement Learning for Mobile Agents with Individual Goals
- Setting Out a Software Stack Capable of Hosting a Virtual ROS-based Competition
- Similarity Modeling on Heterogeneous Networks via Automatic Path Discovery
- GMAC: A Distributional Perspective on Actor-Critic Framework
- Injective State-Image Mapping facilitates Visual Adversarial Imitation Learning
- Count-Based Temperature Scheduling for Maximum Entropy Reinforcement Learning
- Reinforcement Explanation Learning
- VisualEnv: visual Gym environments with Blender
- On The Transferability of Deep-Q Networks
- Scheduling and Power Control for Wireless Multicast Systems via Deep Reinforcement Learning
- Medical Vision Language Models as Policies for Robotic Surgery