1 paper · 1 filter
Viktor Stein, Adwait Datar, Nihat Ay
Kullback-Leibler (KL) divergence regularization is widely used in reinforcement learning, but it becomes infinite under support mismatch and can degenerate in low-noise regimes. Us…