1 paper
Yunchang Ma, Tenglong Liu, Yixing Lan +4
In offline reinforcement learning, value overestimation caused by out-of-distribution (OOD) actions significantly limits policy performance. Recently, diffusion models have been le…