1 paper
Hiroaki Shiino, Kaito Ariu, Kenshi Abe +1
Bandit algorithms for online learning to rank (OLTR) problems often aim to maximize long-term revenue by utilizing user feedback. From a practical point of view, however, such algo…