2 papers
cs.LG2019
Exploring Offline Policy Evaluation for the Continuous-Armed Bandit Problem
Jules Kruijswijk, Petri Parvinen, Maurits Kaptein
The (contextual) multi-armed bandit problem (MAB) provides a formalization of sequential decision-making which has many applications. However, validly evaluating MAB policies is ch…
cs.LG2018
contextual: Evaluating Contextual Multi-Armed Bandit Problems in R
Robin van Emden, Maurits Kaptein
Over the past decade, contextual bandit algorithms have been gaining in popularity due to their effectiveness and flexibility in solving sequential decision problems---from online…