1 paper
Mianchu Wang, Yue Jin, Giovanni Montana
Offline reinforcement learning (RL) aims to infer sequential decision policies using only offline datasets. This is a particularly difficult setup, especially when learning to achi…