1 paper
Zechen Wu, Amy Greenwald, Ronald Parr
In off-policy policy evaluation (OPE) tasks within reinforcement learning, Temporal Difference Learning(TD) and Fitted Q-Iteration (FQI) have traditionally been viewed as differing…