1 paper · 1 filter
Shuo He, Lang Feng, Xin Cheng +2
Reinforcement learning for large language models suffers from high-variance token-level importance sampling (IS) ratios, which would destabilize policy optimization at scale. To im…