Showing cs.LGShow all
2 papers · 1 filter
cs.LG2025
Online Episodic Convex Reinforcement Learning
Bianca Marin Moreno, Khaled Eldowa, Pierre Gaillard +2
We study online learning in episodic finite-horizon Markov decision processes (MDPs) with convex objective functions, known as the concave utility reinforcement learning (CURL) pro…
cs.LG2024
MetaCURL: Non-stationary Concave Utility Reinforcement Learning
Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard +1
We explore online learning in episodic loop-free Markov decision processes on non-stationary environments (changing losses and probability transitions). Our focus is on the Concave…