1 paper
Yihong Guo, Junjie Luo, Guodong Gao +2
Offline contextual bandits allow one to learn policies from historical/offline data without requiring online interaction. However, offline policy optimization that maximizes overal…