1 paper
Xiao Huang, Xu Liu, Enze Zhang +2
Offline-to-online Reinforcement Learning (O2O RL) aims to perform online fine-tuning on an offline pre-trained policy to minimize costly online interactions. Existing work used off…