1 paper · 1 filter
Jun Song, Niao He, Lijun Ding +1
Trust-region methods based on Kullback-Leibler divergence are pervasively used to stabilize policy optimization in reinforcement learning. In this paper, we exploit more flexible m…