2 papers
cs.LG2023
Reparameterized Policy Learning for Multimodal Trajectory Optimization
Zhiao Huang, Litian Liang, Zhan Ling +3
We investigate the challenge of parametrizing policies for reinforcement learning (RL) in high-dimensional continuous action spaces. Our objective is to develop a multimodal policy…
cs.LG2021
Target Entropy Annealing for Discrete Soft Actor-Critic
Yaosheng Xu, Dailin Hu, Litian Liang +3
Soft Actor-Critic (SAC) is considered the state-of-the-art algorithm in continuous action space settings. It uses the maximum entropy framework for efficiency and stability, and ap…