1 paper
Hongye Cao, Fan Feng, Jing Huo +4
Model-based offline Reinforcement Learning (RL) constructs environment models from offline datasets to perform conservative policy optimization. Existing approaches focus on learni…