2 papers
math.OC2026
Online Markov Decision Processes with Terminal Law Constraints
Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard +1
Traditional reinforcement learning usually assumes either episodic interactions with resets or continuous operation to minimize average or cumulative loss. While episodic settings…
cs.LG2025
Online Episodic Convex Reinforcement Learning
Bianca Marin Moreno, Khaled Eldowa, Pierre Gaillard +2
We study online learning in episodic finite-horizon Markov decision processes (MDPs) with convex objective functions, known as the concave utility reinforcement learning (CURL) pro…