1 paper · 1 filter
Pierre Boudart, Pierre Gaillard, Alessandro Rudi
We study reinforcement learning for episodic Markov Decision Processes (MDPs) whose transitions are modelled by a multinomial logistic (MNL) model. Existing algorithms for MNL mixt…