1 paper
Khaled Nakhleh, Ceyhun Eksin, Sabit Ekin
This paper proposes an agent-based optimistic policy iteration (OPI) scheme for learning stationary optimal stochastic policies in multi-agent Markov Decision Processes (MDPs), in…