1 paper
Ziheng Wei, Annie Qu, Rui Miao
In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values.…