1 paper
Xiaoying Zhang, Junpu Chen, Hongning Wang +4
Off-policy learning, referring to the procedure of policy optimization with access only to logged feedback data, has shown importance in various real-world applications, such as se…