1 paper
Alan Clark, Shoaib Ahmed Siddiqui, Robert Kirk +3
Existing offline reinforcement learning (RL) algorithms typically assume that training data is either: 1) generated by a known policy, or 2) of entirely unknown origin. We consider…