1 paper
Jingxin Zhan, Yuze Han, Zhihua Zhang
Regret minimization (RM) and best-arm identification (BAI) are two fundamental objectives in multi-armed bandits. Among regret-minimizing algorithms, 1/2-Tsallis-INF is a canonic…