1 paper
Lars van der Laan, David Hubbard, Allen Tran +3
Double reinforcement learning (DRL) provides efficient off-policy inference for policy values in nonparametric Markov decision processes (MDPs), but fully nonparametric estimators…