1 paper · 1 filter
Rohan Deb, Stephen J. Wright, Arindam Banerjee
Offline Reinforcement Learning (RL) learns optimal policies from fixed datasets, training a policy once and deploying it at inference time without further refinement. Inspired by m…