1 paper
Rui Miao, Babak Shahbaba, Annie Qu
Offline reinforcement learning (RL) aims to find optimal policies in dynamic environments in order to maximize the expected total rewards by leveraging pre-collected data. Learning…