1 paper
Xin Guo, Anran Hu, Junzi Zhang
When designing algorithms for finite-time-horizon episodic reinforcement learning problems, a common approach is to introduce a fictitious discount factor and use stationary polici…