1 paper
Xubin Zhou, Yipeng Yang, Zhan Li
Maximum entropy reinforcement learning (MaxEnt RL) has become a standard framework for sequential decision making, yet its standard Gaussian policy parameterization is inherently u…