1 paper
Daoyi Li, Yixian Zhang, Chao Yu +2
Offline-to-online (O2O) reinforcement learning aims to leverage policies pretrained on static datasets while improving them through online interaction. However, directly reusing an…