Showing math.OCShow all
2 papers · 1 filter
math.OC2026
Online Markov Decision Processes with Terminal Law Constraints
Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard +1
Traditional reinforcement learning usually assumes either episodic interactions with resets or continuous operation to minimize average or cumulative loss. While episodic settings…
math.OC2023
Efficient Model-Based Concave Utility Reinforcement Learning through Greedy Mirror Descent
Bianca Marin Moreno, Margaux Brégère, Pierre Gaillard +1
Many machine learning tasks can be solved by minimizing a convex function of an occupancy measure over the policies that generate them. These include reinforcement learning, imitat…