1 paper
Ishaq Hamza, Zaiwei Chen
In this paper, we establish last-iterate convergence rates for off-policy actor--critic methods in reinforcement learning. In particular, under a single-loop, single-timescale impl…