1 paper
Zixuan Xia, Quanxi Li
We propose a simple yet effective alternative to reward normalization in policy gradient reinforcement learning by integrating a 1D Kalman filter for online reward estimation. Inst…