1 paper
Yunkai Gao, Jiaming Guo, Fan Wu +1
Offline reinforcement learning (RL) aims to optimize a policy by using pre-collected datasets, to maximize cumulative rewards. However, offline reinforcement learning suffers chall…