3 papers
cs.LG2026
Leveraging Similarities in Multi-Armed Bandits
Khaled Eldowa, Thibaud Rahier, Augustin Cablant +2
In many online learning and bandit problems, the actions we consider possess inherent similarities--for instance because they share latent traits, tags, or hierarchical structure.…
cs.AI2026
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
Pierre Boudart, Pierre Gaillard, Alessandro Rudi
We study reinforcement learning for episodic Markov Decision Processes (MDPs) whose transitions are modelled by a multinomial logistic (MNL) model. Existing algorithms for MNL mixt…
stat.ML2026
Enjoying Non-linearity in Multinomial Logistic Bandits: A Minimax-Optimal Algorithm
Pierre Boudart, Pierre Gaillard, Alessandro Rudi
We consider the multinomial logistic bandit problem in which a learner interacts with an environment by selecting actions to maximize expected rewards based on probabilistic feedba…