1 paper
Liyu Zhang, Haochi Wu, Xu Wan +3
Offline-to-online (O2O) reinforcement learning (RL) pre-trains models on offline data and refines policies through online fine-tuning. However, existing O2O RL algorithms typically…