1 paper
Shengchao Hu, Wanru Zhao, Weixiong Lin +3
Offline reinforcement learning (RL) methods harness previous experiences to derive an optimal policy, forming the foundation for pre-trained large-scale models (PLMs). When encount…