1 paper · 1 filter
Florent Delgrange, Raphael Avalos, Willem Röpke
Safe policy improvement (SPI) offers theoretical control over policy updates, yet existing guarantees largely concern offline, tabular reinforcement learning (RL). We study SPI in…