2 papers
cs.LG2022
Off-policy evaluation for learning-to-rank via interpolating the item-position model and the position-based model
Alexander Buchholz, Ben London, Giuseppe di Benedetto +1
A critical need for industrial recommender systems is the ability to evaluate recommendation policies offline, before deploying them to production. Unfortunately, widely used off-p…
cs.LG2018
Bayesian Counterfactual Risk Minimization
Ben London, Ted Sandler
We present a Bayesian view of counterfactual risk minimization (CRM) for offline learning from logged bandit feedback. Using PAC-Bayesian analysis, we derive a new generalization b…