1 paper
Yunchang Yang, Han Zhong, Tianhao Wu +3
We study stochastic delayed feedback in general multi-agent sequential decision making, which includes bandits, single-agent Markov decision processes (MDPs), and Markov games (MGs…