1 paper
Xudong Yu, Chenjia Bai, Hongyi Guo +2
Offline Reinforcement Learning (RL) faces distributional shift and unreliable value estimation, especially for out-of-distribution (OOD) actions. To address this, existing uncertai…