1 paper
Zhifa Ke, Zaiwen Wen, Junyu Zhang
Temporal difference (TD) learning algorithms with neural network function parameterization have well-established empirical success in many practical large-scale reinforcement learn…