1 paper
Chenhua Fan, Jiahui Zhu, Yuhang Zhang +1
Safe reinforcement learning maximizes reward subject to safety constraints. For Constrained Markov Decision Processes, the linear-programming view over occupancy measures implies t…