1 paper
Jin Zhu, Xin Zhou, Jiaang Yao +5
Offline reinforcement learning (RL) aims to learn an optimal policy from pre-collected data. However, it faces challenges of distributional shift, where the learned policy may enco…