1 paper
Yuqi Kong, Xiao Zhang, Weiran Shen
We study the Inverse Contextual Bandit (ICB) problem, in which a learner seeks to optimize a policy while an observer, who cannot access the learner's rewards and only observes act…