1 paper
Haolin Liu, Chen-Yu Wei, Julian Zimmert
We study online reinforcement learning in linear Markov decision processes with adversarial losses and bandit feedback, without prior knowledge on transitions or access to simulato…