1 paper
Prajit T Rajendran, Fabio Arnez, Huascar Espinoza +2
In high stakes environments, agents relying purely on imitation learning or reinforcement learning often struggle to avoid safety-critical errors during exploration. Existing reinf…