1 paper
Mengxiao Zhang, Yingfei Wang, Haipeng Luo
A recent work by Schlisselberg et al. (2024) studies a delay-as-payoff model for stochastic multi-armed bandits, where the payoff (either loss or reward) is delayed for a period th…