1 paper
Siyuan Chen, Hanshen Yu, Jamal Yagoobi +1
Existing approaches to enforcing design constraints in Reinforcement Learning (RL) applications often rely on training-time penalties in the reward function or training/inference-t…