1 paper · 2 filters
Longxiang He, Deheng Ye, Junbo Tan +2
Pretraining a policy on offline data followed by fine-tuning through online interactions, known as Offline-to-Online Reinforcement Learning (O2O RL), has emerged as a promising par…