1 paper
Padmanaba Srinivasan, William Knottenbelt
Offline reinforcement learning (RL) methods aim to learn optimal policies with access only to trajectories in a fixed dataset. Policy constraint methods formulate policy learning a…