1 paper · 1 filter
Hongzhi Zhang, Jia Fu, Jingyuan Zhang +4
Reinforcement learning (RL) for large language models is an energy-intensive endeavor: training can be unstable, and the policy may gradually drift away from its pretrained weights…