1 paper
Rikiya Takehi, Masahiro Asami, Kosuke Kawakami +1
Off-policy learning (OPL) in contextual bandits aims to learn a decision-making policy that maximizes the target rewards by using only historical interaction data collected under p…