1 paper
Luca Serfilippi, Giorgio Franceschelli, Antonio Corradi +1
Policy gradient methods usually rely on entropy regularization to prevent premature convergence. However, maximizing entropy indiscriminately pushes the policy towards a uniform di…