1 paper · 1 filter
Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan +1
Safe robot control requires maximizing return while satisfying safety constraints. In off-policy safe reinforcement learning, reward and safety Q-values are commonly learned by sep…