1 paper
Soumyadeep Roy, Shashwat Kushwaha, Ambedkar Dukkipati
Offline reinforcement learning (RL) enables policy learning from static data but often suffers from poor coverage of the state-action space and distributional shift problems. This…