1 paper · 1 filter
Daoyi Li, Yixian Zhang, Wenbo Ding +2
Offline-to-online (O2O) reinforcement learning aims to leverage policies pretrained on static datasets while improving them through online interaction. However, directly reusing an…