1 paper
M. Forzo, E. Monzio Compagnoni, A. Russo +1
Temporal difference (TD) learning with linear function approximation is a core method for policy evaluation. Its classical continuous-time description is an ordinary differential e…