1 paper
Letian Yang, Xu Liu, Yiqiang Lu +3
Offline-to-online reinforcement learning harnesses the stability of offline pretraining and the flexibility of online fine-tuning. A key challenge lies in the non-stationary distri…