1 paper
Dominik Wagner, Ankit Kanwar, Luke Ong
In safety-critical domains, reinforcement learning (RL) agents must often satisfy strict, zero-cost safety constraints while accomplishing tasks. Existing model-free methods freque…