1 paper
Ting Zhou, Zhenqing Ling, Yiyang Zhao +2
Online reinforcement learning is widely used to align large language models (LLMs) with reward signals, yet training can be unstable under noisy or misspecified rewards. We identif…