1 paper
Ting Hu, Luanda Cai, Emmanouil-Vasileios Vlatakis-Gkaragkounis
We study adversarial multi-armed bandits with and without delayed feedback under a safety-aware goal: achieving minimax-optimal worst-case regret while keeping nearly constant regr…