1 paper
Xingguo Chen, Chaohui Wu, Jinguo Ye +5
Off-policy temporal-difference (TD) learning with function approximation faces a structural tradeoff among stability, projection geometry, and variance control. Emphatic TD (ETD) i…