1 paper
Wenwu Fan, Qihong Lin, Zhijie Xia +4
Reinforcement Learning (RL) training for Large Language Models (LLMs) often suffers from instability due to the discrepancy between training and inference. This training-inference…