1 paper · 1 filter
Xue Zhou, Dapeng Man, Chen Xu +6
Offline reinforcement learning (RL) heavily relies on the coverage of pre-collected data over the target policy's distribution. Existing studies aim to improve data-policy coverage…