1 paper
Junghyuk Yeom, Yonghyeon Jo, Jungmo Kim +2
Constraint-based offline reinforcement learning (RL) involves policy constraints or imposing penalties on the value function to mitigate overestimation errors caused by distributio…