1 paper · 1 filter
Yihong Guo, Junjie Luo, Guodong Gao +2
Offline contextual bandits allow one to learn policies from historical/offline data without requiring online interaction. However, offline policy optimization that maximizes overal…