Reinforcement Learning with Parameterized Actions
arXiv:1509.01644
Abstract
We introduce a model-free algorithm for learning in Markov decision processes with parameterized actions-discrete actions with continuous parameters. At each step the agent must select both which action to use and which parameters to use with that action. We introduce the Q-PAMDP algorithm for learning in these domains, show that it converges to a local optimum, and compare it to direct policy search in the goal-scoring and Platform domains.
Accepted for AAAI 2016
Cited by in corpus (21)
- TMM-Fast: A Transfer Matrix Computation Package for Multilayer Thin-Film Optimization
- Adaptive Skills, Adaptive Partitions (ASAP)
- One model Packs Thousands of Items with Recurrent Conditional Query Learning
- Parameterized Reinforcement Learning for Optical System Optimization
- Continuous-Discrete Reinforcement Learning for Hybrid Control in Robotics
- Learning Event-triggered Control from Data through Joint Optimization
- Reinforcement Learning for Molecular Design Guided by Quantum Mechanics
- Deep Reinforcement Learning for Event-Triggered Control
- Deep Imitation Learning for Bimanual Robotic Manipulation
- Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning
- Hierarchical Approaches for Reinforcement Learning in Parameterized Action Space
- Marginal Policy Gradients: A Unified Family of Estimators for Bounded Action Spaces with Applications
- Accelerating Robotic Reinforcement Learning via Parameterized Action Primitives
- Curious Exploration and Return-based Memory Restoration for Deep Reinforcement Learning
- HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation
- Hierarchical Skills for Efficient Exploration
- Behavior Planning at Urban Intersections through Hierarchical Reinforcement Learning
- Parameterized MDPs and Reinforcement Learning Problems -- A Maximum Entropy Principle Based Framework
- Guided Policy Search for Parameterized Skills using Adverbs
- SMT-based Robot Transition Repair
- Active exploration in parameterized reinforcement learning