1 paper · 1 filter
Xubin Zhou, Yipeng Yang, Zhan Li
Maximum entropy reinforcement learning (MaxEnt RL) has become a standard framework for sequential decision making, yet its standard Gaussian policy parameterization is inherently u…