1 paper
Lingwei Zhu, Haseeb Shah, Zheng Chen +2
Behavior Regularized Policy Optimization (BRPO) leverages asymmetric divergence regularization to mitigate distribution shift in offline reinforcement learning. This paper is the f…