3 papers
math.OC2026
Online Markov Decision Processes with Terminal Law Constraints
Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard +1
Traditional reinforcement learning usually assumes either episodic interactions with resets or continuous operation to minimize average or cumulative loss. While episodic settings…
cs.LG2025
Online Episodic Convex Reinforcement Learning
Bianca Marin Moreno, Khaled Eldowa, Pierre Gaillard +2
We study online learning in episodic finite-horizon Markov decision processes (MDPs) with convex objective functions, known as the concave utility reinforcement learning (CURL) pro…
cs.LG2024
MetaCURL: Non-stationary Concave Utility Reinforcement Learning
Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard +1
We explore online learning in episodic loop-free Markov decision processes on non-stationary environments (changing losses and probability transitions). Our focus is on the Concave…